Lokale KI ist endlich brauchbar, so geht's (Odysseus)
Lokale KI Modelle, also KI Modelle, die
komplett bei dir auf dem Rechner laufen,
ohne dass deine Daten dein Gerät
verlassen, hat sich für mich schon immer
gut angehört, aber in der Praxis nie so
richtig funktioniert. Die Modelle waren
nicht gut genug und für halbwegs
brauchbare Ergebnisse hast du auch echt
teure Hardware gebraucht. Deshalb habe
ich das Thema hier auf dem Kanal auch
noch nicht behandelt. Aber wenn man sich
mal die KI Entwicklung der letzten
Monate anschaut, dann zeichnen sich so
ein paar Trends ab, die lokale KI immer
interessanter machen. Und genau deshalb
wollen wir uns das Thema heute gemeinsam
genauer anschauen. Dabei schauen wir uns
drei Dinge an. Erstens, warum lokale KI
gerade so an Bedeutung gewinnt.
Zweitens, wie man damit auch wirklich
gut arbeiten kann. Also nicht nur in so
einem nackten Chatfenster wie bei Olama
z.B., sondern mit einem Open Source
Programm, das alle Funktionen
beinhaltet, die du auch von Chat GPT
oder Cloud kennst. also Deep Research,
Memory, Dokumentenbearbeitung und so
weiter. Und drittens schauen wir uns an,
wie du dich auch ohne starke Hardware
unabhängiger von den großen Anbietern
wie Antropic oder Open AI machst.
Entweder indem du die Modelle natürlich
lokal hostest oder z.B. günstigere
Modelle über die API nutzt und damit
nicht in einem teueren Abo festhängst
oder die Modelle auch über einen GPU
Anbieter wie Olama Cloud laufen lässt.
Also lass uns direkt einsteigen. Schauen
wir uns erstmal an, warum das Thema
gerade so an Bedeutung gewinnt. Vor ca.
einer Woche gab es einen Moment, der
ziemlich gut gezeigt hat, warum es so
wichtig ist, dass man sich etwas
unabhängiger macht von den großen
amerikanischen Techunternehmen. Die
US-Regierung hatic angewiesen, den
Zugang zu ihrem stärksten Modell Fable 5
und Mythus 5 für sämtliche ausländische
Nutzer zu sperren. Es gab wohl Bedenken
über die nationale Sicherheit und
deswegen musste Anthropic die Modelle
praktisch über Nacht für alle
nichtamerikanischen Kunden abschalten.
Das heißt, ein Spitzenmodell, das
Millionen von Leute produktiv schon
genutzt haben, war von heute auf morgen
einfach weg. Nicht, weil das Unternehmen
es wollte, sondern weil eine Regierung
es so angeordnet hat. Und der
eigentliche Knackpunkt ist auch, die
Anordnung richtete sich gezielt gegen
alle nichtamerikaner. Das heißt, die
Amerikaner durften die Modelle also
weiter nutzen, alle anderen auf der Welt
aber nicht mehr. Abgeschaltet wurde es
am Ende trotzdem für alle, weil Enhropic
gar nicht sauber trennen konnte, wer
jetzt amerikanischer Nutzer ist und wer
nicht. Aber das Kern des Problems ist
trotzdem, wenn deine Arbeit auf einem
Modell aufbaut, das jemanden anderem
gehört, kann dir der Zugang jederzeit
entzogen werden aus politischen Gründen,
aus rechtlichen Gründen oder sogar, weil
sich einfach ein Geschäftsmodell ändert.
Und es muss dafür nicht mal die
komplette Abschaltung des Zugangs sein.
Genauso gut kann ein Anbieter auch
einfach entscheiden, die Preise
drastisch anzuziehen und schon rechnet
sich dein ganzes Setup vielleicht nicht
mehr. Und das ist auch gar nicht so weit
hergeholt, wenn man sich mal die
Wirtschaftlichkeit der Abonnements von
JGPT oder Clud anschaut, die rechnen
sich nämlich für die Anbieter oft gar
nicht und Sam Oldman hat sogar selbst
schon von dem Jahr zugegeben, dass sie
mit ihrem 200 $ Abo eigentlich Geld
verlieren, einfach weil die Leute es
viel mehr nutzen, als sie erwartet
hatten. Und [räuspern] das ist immer
noch so und bei Enhropic auch nicht
anders. Und das merkst du auch vor allem
daran, dass in Tropic eine lange Zeit
lang ziemlich streng mit ihren
Nutzungslimits war und das auch immer
noch ist, finde ich, vor allem bei den
Pro Plänen, da stößt du gefühlt nach ein
zwe Stunden schon direkt an deinem
Tageslimit. Das heißt, wenn du dein
Cloud oder ChatGPT Abo wirklich bis ans
Ende ausreiz, dann machst du dem
Unternehmen viel mehr Verlust, als du
ihn eigentlich einbringst. Das heißt,
langfristig sind diese Abonnements gar
nicht tragbar für die Firmen, wenn die
neuesten und teuersten und besten
Modelle dort immer inbegriffen sind. Und
allein deswegen kann ich mir auch sehr
gut vorstellen, dass die besten und
teuersten Modelle gar nicht mal mehr in
diesen Abos enthalten sein werden.
Anthopic hatte ja auch eigentlich
vorgehabt, Fable 5 für einen Monat in
deinem Abonnement verfügbar zu machen,
obwohl das Modell laut den Tokenkosten
über die API sowohl im Input als auch im
Output doppelt so teuer ist wie Opus
4.8. Das heißt, sie wollten einfach nur
der Menschheit da draußen zeigen, wie
stark dieses Modell ist. Und ich kann
mir sehr gut vorstellen, dass sie nach
einem Monat dann gesagt hätten, okay,
das Modell ist ziemlich krass, ne? Ihr
habt's jetzt ausprobiert, wir können das
aber nicht mehr den Abonnements zur
Verfügung stellen. Also musst du das
leider über die API nutzen. Das heißt,
man hat gesehen, wie stark dieses Modell
ist und wie viel man damit machen kann
und man gewöhnt sich natürlich auch an
diese Leistung und möchte das weiterhin
nutzen und ist dann aber auch natürlich
viel mehr bereit dafür, ziemlich teure
Tokenpreise zu bezahlen. Und die
Tokenpreise sind auch jetzt nicht ohne,
also $ pro eine Million Output Tokens
und 50$ pro eine Million Output Tokens.
Und theoretisch kann diese Preise von
heute auf morgen einfach höher stellen
und das trifft dann natürlich jeden, der
seine Systeme, seine Automatisierungen,
seine ganzen Workflows auf dieses Modell
aufgebaut hat. Das heißt, das macht dich
ziemlich abhängig. Und der zweite Punkt
ist natürlich das Thema Daten. Google,
Anthropic, Open AI und alle anderen
großen Teagfirmen sind am schärfsten
darauf und entsprechend viel sammeln sie
auch. Und dass das nicht immer gut
endet, sieht man aber auch sehr
regelmäßig. Immer öfter kommt es zu
irgendwelchen Data Breaches bei größeren
Firmen. Erst Anfang des Jahres wurde bei
einer KI Chat App aufgrund einer
Fehlkonfiguration ein Datenl entdeckt,
bei dem rund 300 Millionen Nachrichten
von etwa 25 Millionen Nutzern offen im
Netz lagen. Auch Open AI musste bereits
in Vorfall einräumen, bei denen Namen
und Mailadressen abgeflossen sind. Und
die Reaktion bei diesen Film ist dann
meistens immer so, ja, tut uns leid, ne,
ist halt passiert, ja, können wir jetzt
auch nichts mehr machen. Aber wir werden
natürlich in Zukunft darauf achten, dass
das nicht noch mal passiert. Und ich
weiß, das ist den meisten auch schon
klar, aber ich will es trotzdem noch mal
erwähnen. Alles, was du in ChatGPT oder
in Cloud oder in Gemini hier
reinschreibst, landet am Ende auf
fremden Servern und du musst darauf
vertrauen, dass dort sorgfältig mit
diesen Daten umgegangen wird. Und wegen
diesen zwei Punkten ist lokale KI
natürlich sehr interessant, nicht
unbedingt als Ersatz für alles, sondern
auch eher als zweites Standbein. Also,
dass du einfach etwas hast, das
funktioniert, egal, was die Anbieter
gerade entscheiden und bei dem deine
Daten deinen Rechner nicht verlassen.
Ich bin jetzt z.B. gerade mein LM Studio
und habe hier das Gamma 4 Modell mit 12
Milliarden Parametern runtergeladen und
ich habe jetzt auch definitiv nicht den
krassesten PC hier stehen, aber schau
mal bitte, wie schnell mir das Modell
antwortet, wenn ich frage, was kannst
du? Das ist ja eigentlich genauso
schnell, wie man das auch von JGPT
kennt. Und es gibt sogar eine Version
von dem Modell, das Bilder verstehen
kann. Also, es ist ein multimodales
Modell. Das heißt, ich kann jetzt z.B.
das Foto von den vier Hunden hier
nehmen, hier einfügen und sagen, was
siehst du hier? Und wir sehen, das ist
auch ein Thinking Modell. Also die
Version gibt's auch, dass es erstmal
nachdenkt, bevor es eine Antwort gibt
und sehen sogar schon, dass er das Bild
analysiert, ne? Der erste Hund ganz
links, der zweite Hund, dritte Hund,
vierte Hund. Auf diesem Bild sieht man
vier verschiedene Hunde, die fröhlich
über eine grüne Wiese direkt auf die
Kamera zulaufen. Genau richtig. Und auch
wenn du jetzt überhaupt keine Hardware
hast, um solche Lokalmodelle laufen zu
lassen, gibt es immer noch Alternativen.
Wir haben auch in Europa bereits die
Möglichkeit auf gute KI zurückzugreifen,
nämlich bei Mistral. Die Modelle von
Mistral haben sich in den vergangenen
Monaten auch sehr sehr stark verbessert,
weswegen man für sehr viele
Anwendungsfälle auch die amerikanischen
Modelle gar nicht mal nutzen muss. Der
Punkt ist einfach, sich nicht von einem
einzigen Anbieter abhängig zu machen und
sich langfristig breiter aufzustellen.
Wenn du jetzt aber wirklich auf lokale
KI gehen willst, ist diese nicht nur aus
Unabhängigkeitssicht spannend, sondern
mittlerweile auch technisch sehr
spannend. und zwar, weil die Modelle
immer effizienter werden. Klar, bei den
ganz großen Anbietern geht's immer noch
darum, ne, immer größere Modelle, immer
mehr Parameter, immer besser mehr
Rechenleistung. Aber es gibt jetzt eben
auch den anderen Trend und der ist für
uns viel interessanter, wenn es um
lokale KI geht, nämlich möglichst
effiziente Modelle für möglichst kleine
Hardware. Vor allem die Chinesen
verfolgen diesen Ansatz und das wird
auch immer wichtiger, weil Hardware ja
eher teuer wird als billiger. Und das
sieht man vor allem an den RAMpreisen,
die steigen schon seit Monaten und das
ist auch kein Zufall. Denn der KI Boom
frisst eigentlich die ganzen
Produktionskapazitäten der
Speicherhersteller. Die bauen jetzt vor
allem eben den speziellen Speicher für
KI Rechenzentren und für normalen
Arbeitsspeicher bleibt einfach weniger
übrig. Das heißt, weniger Angebot,
trotzdem noch steigende Nachfrage, also
steigen die Preise. Umso besser, aber,
wenn die KI Modelle auch weniger
Hardware benötigen, um trotzdem gut zu
laufen. Man stellt sich dann natürlich
trotzdem die Frage, okay, reichen diese
kleinen Modelle überhaupt? Und für die
absolute Spitze von Aufgaben natürlich
nicht, das muss man ganz klar sagen,
aber für den Großteil der alltäglichen
Aufgaben, also Texte entwerfen,
zusammenfassen, umformulieren und Fragen
beantworten, dafür reichen diese Modelle
schon völlig aus. Und das sieht man auch
ganz konkret an Modellen, wie z.B. die
Gammer Modelle von Google. Das sind
kleine Modelle, die genau dafür gemacht
sind, lokal zu laufen, von Varianten
fürs Handy bis zu größeren, die trotzdem
auf einen normalen Rechner passen. Und
vor allem die chinesischen Labs treiben
diese Effizienz besonders hart voran.
Und das hat auch einen Grund, denn durch
die US Exportbeschränkungen kommen sie
an die besten und teuersten KI Chips gar
nicht erst ran. Das heißt, sie müssen
also das Maximum aus schwächerer
Hardware herausholen und genau das hat
ihre Modelle auch so effizient gemacht.
Deepsieg z.B. ist dadurch im Betrieb
deutlich günstiger als die großen
US-Modelle, hat aber es trotzdem
geschafft, sehr sehr ähnliche Leistungen
abzuliefern. Aber das machen wie gesagt
nicht nur die Chinesen und Google sagt,
du kannst Scammer schon auf einem ganz
normalen Laptop mit rund 16 GB RAM
laufen lassen und zwar auch ohne
Grafikkarte. Man muss natürlich dazu
sagen, ohne Grafikkarte läuft es
deutlich langsamer, aber du kannst es
trotzdem nutzen. Und 16 GB RAM hat heute
fast jeder Laptop, vielleicht sogar
einer, der bei dir noch irgendwo
rumliegt. Erst für die richtig großen
Modelle brauchst du eine sehr gute
Grafikkarte mit auch wirklich viel VRAM.
Das heißt, lokale KI wird sowohl aus
politischer und Unabhängigkeitssicht als
auch aus technischer Sicht besonders
interessant. Und jetzt wollen wir uns
gemeinsam anschauen, wie denn überhaupt
die Arbeit mit lokalen KI Modellen
aussehen kann. Wie kann man sich das
komfortabel einrichten, damit es sich
auch so anfühlt, als würde man einfach
JGBT oder Cloud nutzen. Und es gibt eben
lokale Programme wie Olama oder auch LM
Studio, bei denen du dir lokale Modelle
einfach runterladen kannst. Ich kann
hier z.B. links auf Model Search gehen
und sehe hier einige Modelle, die ich
einfach direkt herunterladen kann, wie
eben z.B. hier Gamma 4 mit 12 Milliarden
Parametern. Das Modell ist 7 GB groß und
ich kann jetzt hier mit diesem Modell
schreiben. Ich kann auch hier rechts
Dateien hochladen oder auch Bilder und
dann auch z.B. über die Dateien chatten.
Aber mir persönlich fehlen hier bei LM
Studio oder auch bei Olama noch einige
Möglichkeiten, die man vielleicht von
CHGPT kennt. Z.B. die Deep Research
Funktion oder auch die Möglichkeit
Dokumente zu bearbeiten, also nicht nur
hochzuladen und darüber zu schreiben,
sondern z.B. einen Dokumenteneditor,
der, wenn jetzt hier ein Text generiert
wird, hier rechts aufgeklappt wird und
man dort sogar dann einfach
weiterschreiben kann, um den Text
anzupassen oder auch irgendwie so eine
Agent Funktionalität, denn sehr viele
von diesen Modellen können auch Tools
ausführen. Das heißt, damit haben wir
ein Modell, das nicht nur Antworten
geben kann, sondern auch wirklich
Aufgaben erledigen kann. Und ich weiß,
es gibt Tools wie Hermes, die in diese
Richtung gehen, ne, die einfach Aufgaben
für dich abnehmen und das funktioniert
auch alles mit lokalen Modellen. Das ist
auch schön und gut, aber ich wollte
jetzt einfach diese Standard KI
Oberfläche wie bei Chat GPT oder Cloud,
wo man einfach nur schreiben kann, mit
Dokumenten arbeiten kann und so weiter,
vielleicht auch seine E-Mails, sein
Kalender und sowas zugreifen kann, nur
eben lokal. Und da bin ich dann über ein
Open Source Projekt namens Odysseus
gestoßen, dass eben genau diese
Kapazitäten, also Chats, Agents,
Recherche, Dokumenten, E-Mails, Notizen,
Kalender und eben auch lokale Workflows
in einem Programm vereint. Und das Ganze
läuft bei mir jetzt hier lokal und ich
habe hier rechts genauso wie jetzt in LM
Studio oder Olama hier ein paar Modelle
angebunden, wie z.B. das Scammer 4
Modell. Ich kann hier rechts auswählen,
ob ich einfach nur chatten möchte oder
eben auch die Agent Funktionalitäten
brauche. Also sowas, dass er auch lokal
Code ausführen kann oder dass er eben
z.B. im Internet recherchieren kann. Und
ich finde die Integrationen hier mega
cool. Man hat z.B. die Möglichkeit
direkt sein E-Mailpostfach anzubinden.
Ich habe jetzt einfach mal irgendeine
Mail hier geöffnet und kann hier z.B.
auch direkt mit dem lokalen Modell die
Mail zusammenfassen hier oben. Ich kann
sogar von der KI eine Nachricht
generieren lassen. Hey there, thanks for
the Update blablabla. Ich kann dir jetzt
auch direkt hier unten verschicken. Das
heißt, ich kann jetzt ziemlich schnell
eben meine ganzen Mails bearbeiten und
dabei alles lokal auf meinem Rechner.
Man kann eben auch so verschiedene Tabs
öffnen und die dann halt irgendwo
hinziehen. Und es kommen noch weitere
nützliche Funktionen hinzu, wie z.B. das
Brain. Hier merkt sich das System Sachen
über mich. Also, ich habe z.B. letztens
geschrieben, dass meine Lieblingsfrucht
Wassermelone ist und das hat er sich
dann hier gespeichert. Wenn ich z.B.
schreibe, mein Lieblingssport ist
Fußball, dann sehen wir jetzt hier, dass
das Modell das erkennt als Fakt und das
jetzt eben in das Memory speichert. Das
heißt, die Funktion, dass ich das
Programm auch etwas über dich merkt, so
wie bei JGBT oder Cloud gibt es hier
auch. Wenn ich hier zurück zum Brain
gehe, sehe ich ganz genau, der
Lieblingssport des Benutzers ist
Fußball. Ich kann hier eigene Memories
anlegen und ich kann sogar Skills
importieren, ne? Das sind ja wichtige
Anleitungen für agentische Systeme,
damit die bestimmte Aufgaben einfach
immer wieder erledigen können, ohne dass
du dich neu erklären musst. Und ich habe
jetzt hier unter den Skills auch z.B.
schon den Skill Creator Skill
heruntergeladen, der offiziell von
Anthropic erstellt wurde, um eben den im
Sprachmodellen zu erklären, wie sie
Skills erstellen können, wenn ich jetzt
einen eigenen Skill anlegen möchte.
Sowas kannst du z.B. auch bei Cloud
anlegen, aber eben auch bei Odyssey
haben ja sogar einen eingebauten
Kalender, das heißt hier kann das Modell
dann drauf zugreifen. Wir können ja
Termine eintragen und eben auch auslesen
und man kann auch seine eigenen Termine
hier importieren. Ich persönlich würde
das jetzt wahrscheinlich nicht so viel
nutzen, aber ich finde es trotzdem eine
coole Idee. Was ich auch sehr cool
finde, ist die Compare Funktion. Da
kannst du verschiedene Modelle, die du
hier installiert hast oder die du dann
auch per API auswählen kannst, wenn du
jetzt nicht lokal arbeiten möchtest,
miteinander vergleichen. Und das kannst
du sogar blind machen, damit du nicht
voreingenommen bist. Ganz oft willst du
ja sehen, wie verschiedene Modelle auf
einen prompt antworten und dann nimmst
du einfach die beste Antwort für dich.
Ich kann auch den Typ auswählen, also
soll das jetzt im Chat getestet werden,
in der Agent Funktionalität, in der
Websuche oder auch in der
Tiefenrecherche, wir machen es jetzt
einfach mal im Chat. Ich habe z.B. das
Quen 3 Modell jetzt hier und auch Gamma
4 und ich kann jetzt beiden Modellen
dieselbe Aufgabe stellen. Schreibe ein
Gedicht über Elefanten und ich sehe
jetzt nicht, welches Modell welches ist
und weil meine Grafikkarte jetzt nicht
beide Modelle gleichzeitig packt, wird
erstmal Modell A jetzt hier ausgeführt
und dann Modell B. Und dann haben jetzt
beide Modelle hier was geschrieben und
ich kann jetzt entscheiden, welches ich
davon mehr mag. Und wenn ich jetzt hier
unten auf Reveal klicke, sehe ich jetzt
oben, welches Modell das eigentlich war.
Das find ich schon eine ziemlich coole
Funktion, auch nicht nur mit lokalen
Modellen, sondern wenn du auch über die
API verschiedene größeren Modelle mal
testen möchtest. Was auch sehr gut ist
bei Odysseoice, ist die Deep Research
Funktion. Du gibst hier oben einfach nur
eine Frage ein und der recherchiert dann
erstmal zu dem Thema und schreibt dann
einen sehr ausführlichen Artikel. Ich
habe ja z.B. gestern schon die Frage
gestellt, was ist ein Agent Harness und
wie funktioniert sowas? Und was ich mega
cool finde, ist, dass du nicht einfach
nur einen Text zurückbekommst, sondern
einen vollständigen Blogartikel, der
richtig gut aussieht, auch optisch, den
du theoretisch auch direkt als
Blogartikel posten kannst. Und hier
sehen wir dann den gesamten Artikel,
können uns den durchlesen, der ist schön
formatiert und ganz unten können wir
sogar auf Discuss gehen und dann können
wir sogar direkt über diese Recherche
noch mal mit unserem Agenten chatten.
Und es gibt weitere Funktionen, wie z.B.
Notizen, die man sich direkt anlegen
kann. Man kann sogar Aufgaben sofort
tracken und eben auch von der KI hier
erstellen lassen. Du kannst, wie du
lustig bist, hier auch das Theme ändern,
ne? Also falls hier irgendwie ein
anderes Design noch mehr liegt, kannst
du das ganz einfach hier einstellen.
Kannst s aber natürlich auch frei
anpassen. Und natürlich kannst du auch
mit Dokumenten arbeiten. Das macht man
hier unter Library. Hier kannst du
Dokumente hochladen, auf die die Modelle
dann auch zurückgreifen können. Und was
ich eben auch sehr cool finde, ist die
Dokumentenbearbeitung. Ich kann jetzt
z.B. sagen, ich möchte einen Blogartikel
haben über lokale KI und dieser soll
eben in der Library abgespeichert
werden. Dann kann ich hier auf Library
gehen und sehe hier dann den Artikel und
ich kann den Artikel dann auch direkt
öffnen und dann öffnet sich hier rechts
so ein Fenster, wo ich den Artikel dann
auch direkt bearbeiten kann. Also ich
kann hier dann selber reinschreiben,
denn der KI Text ist natürlich nie
wirklich so perfekt, dass man ihn
einfach so lassen kann. Man möchte
natürlich hier noch was reinschreiben,
mal ein paar Sachen anpassen, mal
irgendwas rausstreichen, wie auch immer.
Und das kann ich jetzt problemlos machen
und das dann einfach abspeichern. Das
ist z.B. für eine Sache, die mich bei
Cloud sehr stört, denn ich habe dem
jetzt hier die gleiche Aufgabe gegeben
und der hat dann hier auch ein Dokument
erstellt, hier eine Mark Datei und ich
kann die einfach nicht bearbeiten. Also
ich kann hier nicht reinklicken, ich
kann nur Kommentare geben, aber ich kann
hier nicht direkt reinschreiben und das
ist finde ich einfach ziemlich nervig,
weil ich dann wieder ein anderes
Dokument öffnen muss, ein anderes
Programm, nur um hier den Text zu
bearbeiten. Und falls du jetzt auch
selber keine Ahnung hast, was für lokale
Modelle du überhaupt laufen lassen
kannst auf deinem PC, kannst du hier
auch ins Cookbook reinschauen. Hier
unten werden dir dann Modelle empfohlen,
die zu deiner Hardware passen, denn das
ist vor allem auch als Anfänger ziemlich
schwer einzuschätzen, was kann überhaupt
auf meinem PC laufen. Und wie gesagt, du
kannst hier auch jederzeit Modelle per
API hinzufügen, ne, weil du jetzt
irgendwie mit stärkeren Modellen
arbeiten willst. Kannst ja z.B. auch
direkt MAL verbinden, wenn du jetzt mit
europäischen Anbietern arbeiten
möchtest. Und eine letzte Sache noch,
dann höre ich auch auf, aber ich finde
es einfach mega cool. Es gibt ja auch
die Galerie, das heißt, du kannst hier
Bilder hochladen und diese sogar direkt
bearbeiten. Also, ich habe jetzt hier
z.B. mein letztes Video Thumbnail und
hier kann ich das Bild bearbeiten. Ich
kann hier mit so einer Brush drüber
gehen, wenn ich möchte. Ich kann
natürlich auch hier mit dem Radiergummi
drüber. Es gibt sogar eine Impaint
Funktion und auch so ein Background
Removal, aber ja, das finde ich einfach
so ein cooles nices Addon. Vielleicht
ist ja für den ein oder anderen ganz
nützlich. Das Projekt wurde übrigens von
PewDiePie gemacht, einer der größten
YouTuber überhaupt, der sich aber gerade
sehr stark auf lokale KI spezialisiert.
Fand ich ganz witzig. Wenn du dir es
lokal installieren willst und das noch
nie so vorher gemacht hast, würde ich
dir definitiv empfehlen, da mit Cloud
gemeinsam, also Cloud Code oder auch
Codex zu arbeiten, denn du kannst Cloud
Code auch einfach den Link zu diesem
Repository geben, ich verlinke dir den
auch in der Videobeschreibung und sagen,
du möchtest das gerne installieren. COD
wird das dann für dich machen, wird dir
vielleicht sagen, was du noch brauchst
und du wirst bestimmt mal auf das eine
oder andere Problem stößen bei dem
Programm, das Claud dann aber auch
relativ leicht für dich lösen kann. Das
Problem bei mir war z.B., dass ich diese
lokalen Modelle nicht mit meiner
Grafikkarte nutzen konnte. Ich wusste
nicht, warum. Ich habe das dann aber
einfach nur Cloud gesagt und er hat das
dann sofort gelöst und alles
eingerichtet und der hat dann natürlich
auch Zugriff auf Odysseis und kann dort
ganze Einstellungen konfigurieren für
dich, sodass du am Ende einfach nur mit
Cloud Code gemeinsam das Setup machst
und dann Odysseys lokal für dich nutzen
kannst. Das würde ich dir definitiv
empfehlen und das geht auch damit
relativ zügig. Jetzt kann es vielleicht
sein, dass deine Hardware auch nicht
ausreicht, um jetzt hier gute lokale
Modelle laufen zu lassen. Oder
vielleicht hast du selber auch gar keine
Lust, das alles lokal laufen zu lassen,
möchtest aber trotzdem sowas wie Odysse
nutzen, die aber trotzdem Kosten sparen
und nicht 90 € im Monat für ein Cloud
Abonnement ausgeben. Und vielleicht
willst du sowas wie Odysseys auch nicht
nur hier auf deinem Rechner nutzen,
sondern das von überall aus erreichen,
von egal welchem Gerät. Und da will ich
jetzt auch noch mal mehr auf den dritten
Punkt eingehen, denn klar, du machst
dich natürlich komplett unabhängig, wenn
du alles lokal hostest, aber was sind
dann noch Alternativen, wie du dich
trotzdem noch unabhängiger machen
kannst, auch wenn du jetzt nicht alles
lokal bei dir hosten kannst. Und dafür
habe ich eine Tabelle erstellt, die
zeigt, welche Alternativen es noch gibt
und was da so die Vor und Nachteile
sind. Wenn du komplett lokal unterwegs
bist, ist es aus Datensicherheit
natürlich perfekt. Auch die
Nutzungslimits sind unbegrenzt und du
hast auch eigentlich keine Kosten, außer
natürlich den Strom, den du zahlst für
deine Höllenmaschine, die du dann
vielleicht zu Hause stehen hast. Wenn du
jetzt sagst, Datensicherheit ist für
dich jetzt nicht so das oberste Thema
und du möchtest einfach nur solche Open
Source Projekte wie Odysseys nutzen,
aber im Hintergrund günstige Modelle,
die aber wirklich leistungsstark sind
und du auch gar keine Nutzungslimits
hast, dann würde ich dir empfehlen über
die API zu gehen. Das heißt, du zahlst
dann wirklich pro Token, den du
verbrauchst und es gibt Plattformen wie
z.B. Open Router, auf denen du auf alle
Sprachmodelle, die es da draußen gibt,
zugreifen kannst. Das heißt, du musst
dir dort nur einmal einen API erstellen,
ein paar Credits hochladen und dann
kannst du eigentlich alle Modelle
nutzen, denn Open Routrouter leitet die
Anfragen dann einfach nur an die
entsprechenden Anbieter weiter. Und das
Gute da ist auch, du zahlst eben nur für
deine Nutzung, das heißt, du hast keine
Basisgebühr jeden Monat und es gibt eben
auch sehr gute Modelle, eben chinesische
Modelle wie z.B. GLM 5.2, das ist vor
kurzem erst rausgekommen und ich bin ja
jetzt auf dem Artificial Analysis
Leaderboard. Hier sieht man immer so,
was so die besten Modelle sind aktuell
und was sie so kosten und wir sehen ja
natürlich Cloud Fable, Cloud Opus 4.8
und eben GPT 5.5, aber nicht weit unten
sehen wir eben auch schon die
chinesischen Modelle, die im Vergleich
deutlich günstiger sind. Also wir sehen
jetzt hier pro 1 Million Input und
Output Tokens blendet, also das jetzt
sozusagen der durchschnittliche Preis,
kostet es nur 90$ Cent, während hier
z.B. GPT 5.5 schon $ kostet und die
anderen Modelle sind auch ungefähr bei $
und Cloud Fable ist natürlich super
teuer und das obwohl es sehr ähnliche
Leistungen bietet und sogar ein
Kontextfenster von 1 Million Tokens hat.
Das sind 750 000 Wörter. Wenn ich ein
bisschen weiter runter scroll sehe ich
sogar hier Deep Seek V4 Pro. Auch ein
sehr gutes Modell und es kostet nur 18$
Cent. Das ist überhaupt gar nichts. Und
deswegen würde ich dir auch empfehlen,
wenn du über die API gehen willst und
unbegrenzte Nutzung haben möchtest und
es für dich kein Problem ist, wenn deine
Daten in China landen, dann nutzt sowas
wie Deeps V4 oder eben auch GLM 5.2.
Wenn du jetzt aber sagst, das Thema
Datensicherheit ist dir schon wichtig,
aber du hast trotzdem nicht die nötige
Hardware, um KI Modelle lokal laufen zu
lassen, dann würde ich dir die Olama
Cloud empfehlen. Olama stellt nämlich
auch GPU Server zur Verfügung. Das
heißt, Open Source Modelle hosten die
dann auf ihrer Infrastruktur und die
werben eben mit einer deutlich
stringeren Datenschutzregelung als die
großen US-Anbieter. Konkret mit Zero
Data Retention, also keiner Speicherung
deiner Anfragen. Die sagen hier eben
auch konkret keep your data private. Man
muss natürlich dazu sagen, dass die
Daten trotzdem in den USA landen. Das
heißt, sie sagen zwar, deine Daten sind
privat, aber am Ende des Tages verlassen
sie trotzdem dein Gerät. Von daher ist
es immer ein Tradeoff. Das Gute ist
aber, du kriegst dir dafür die großen
Open Source Sprachmodelle wie z.B. z.B.
GLM5.2 oder auch Deepseak V4, die mit
sehr hoher Wahrscheinlichkeit nicht auf
deiner lokalen Hardware aufpassen, für
sogar schon 0 $ und im ProLAN eben nur
für $ im Monat. Und die hosten eben alle
Open Source Modelle. Hier sieht man z.B.
jetzt oben auch das neue Gill M5.2. Das
heißt, wenn du die Modelle auch wirklich
viel nutzt, dann lohnt es sich
vielleicht sogar einfach über das
Abonnement zu gehen und einfach nur
einmal flat 20$ zu zahlen im Monat. Und
du hast hier eben den Vorteil, dass
Olama einen Fokus auf private Daten
legt. Ob das dann am Ende genau stimmt,
kann man natürlich nie genau sagen. Das
heißt, das sind so eigentlich die drei
Alternativen zu dem Standard US
Abonnement, wo du dann natürlich den
Vorteil genießt, die absolut besten
Modelle zu nutzen, die es gerade gibt.
Wenn du dich jetzt für die beiden
mittleren Optionen hier entscheidest,
also ne günstige API Modelle oder Olama
Cloud, dann würde ich dir auch definitiv
empfehlen und Odisoys nicht lokal auf
deinem Rechner laufen zu lassen, sondern
auf einem Server, der auch
hundertprozentig dir gehört, denn da
hast du den Vorteil, dass du von jedem
Gerät aus jederzeit darauf zugreifen
kannst, auch wenn dein PC aus ist. Das
heißt auch vom Handy. Und ich persönlich
hoste alle meine Anwendungen bei
Hostinger. Da habe ich einen Server, wo
jetzt auch mehrere Programme laufen, wie
z.B. Odysseys, aber auch mein Hermis. Es
gibt dir den Docker Manager, wo du
jederzeit verschiedenste neue
Applikationen wie z.B. Oddysois einfach
direkt installieren kannst und das ganze
Setup wird vollständig von Hostinger
übernommen und das macht es natürlich
deutlich einfacher direkt loszulegen,
wenn man keine Ahnung von Server hat.
Falls du noch keinen Server hast, kannst
du auch über so ein Oneclick Install
Template einen Server kaufen, wo
Odisseys dann auch direkt drauf
installiert ist. Und wenn du jetzt auch
planst mehrere Anwendungen zu
installieren, wie z.B. Hermis oder auch
N8N oder andere Open Source Projekte,
dann würde ich dir den KFM 2 Plan
empfehlen. Den nutze ich selber und
hatte bis jetzt noch keine Probleme,
auch wenn ich mehrere Programme
installiert habe. Und wie gesagt, der
Server gehört hundertprozentig dir, nur
du hast darauf Zugriff und der
Serverstandort ist eben auch in
Deutschland. Das ist ganz wichtig und
ich finde eben die Kombination aus
Hostinger, welche die günstigen Server
bereitstellt und Olama Cloud, welche die
günstigen Modelle anbietet mit Fokus auf
Datensicherheit eigentlich die perfekte
Kombi. Du kannst dir übrigens mit dem
Code Jujan Ivanov noch mal 10 % auf alle
Jahrespläne sparen. Nach dem
Zahlungsvorgang wird Odysse für dich
installiert und dann landest du auch
hier im Server Dashboard und hier kannst
du dann Odysseis direkt öffnen und damit
läuft Odyssey auch geschützt im
Internet. Du kannst es erreichen und
kannst dich hier einloggen. Ich habe
jetzt unten rechts z.B. Open Router
verbunden und habe deswegen Zugriff auf
alle Sprachmodelle, die es da draußen
gibt. Wenn du jetzt die Verbindung mit
Olama Cloud machen möchtest, würde ich
dir einfach empfehlen, kurz Cloud zu
fragen, dir bei der Einrichtung zu
helfen. Du musst dafür eigentlich nur
noch als zusätzliche Anwendung hier im
Katalog Olama installieren, genauso wie
du es lokal installieren würdest und
dort musst du dich dann mit deinem
Account anmelden und kannst dann auf
alle Modelle zugreifen und die auch bei
Odysse verknüpfen. Aber wie gesagt, hier
kann dir Cloud auch step by Step helfen.
Das war's auch schon. Damit haben wir
uns jetzt auch angeschaut, was man noch
für Alternativen hat, wenn man es nicht
alles lokal machen kann. Du weißt jetzt
auch Bescheid, warum lokale KI immer
interessanter wird. Die Modelle sind
mittlerweile echt ziemlich gut geworden,
auch bei nicht leistungsstarker
Hardware. Und klar, man kommt nicht an
die Topmodelle ran und für viele Sachen
reicht es vielleicht auch noch nicht,
aber es ist trotzdem gut, dass wir uns
mit dem Thema beschäftigen, um einfach
nur ein zweites Standbein zu haben und
uns unabhängiger von den US-Anbietern
machen können. Falls dir das Video
weitergeholfen hat, dann lasst doch
gerne ein Like und ein Abo da, um
weiteren KI Content nicht zu verpassen.
Ich bedanke mich herzlich fürs Zuschauen
und würde sagen, wir sehen uns beim
nächsten Video wieder. Bis dann.
More transcripts
Explore other videos transcribed with YouTLDR.

A Escola da Conquista - A Vitória sobre Jericó | JB Carvalho
JB Carvalho · Portuguese (Portugal, Brazil)

The Stage That Changes Everything For Traders - Mark Douglas Repeated It
Mark Douglas Wisdom (Fans) · English

Doc. 2007: Full Silaturahim Santri Ndalem PP Maslakul Huda Kajen Pati
Oase Islah 🅥 · English

The Fastest Way to Get Rich (From Any Starting Point) | Earl Nightingale
Evan Carmichael · English

SIMBOL BAHAN KIMIA
WIN'S CHEMISTRY CLASS · Indonesian

Peluang (Part 1) | Definisi Peluang, Komplemen Kejadian dan Frekuensi Harapan Matematika Kelas 12
m4th-lab · English

PAQUITA BALLET pas de trois solo LEARN TOGETHER with Maria Khoreva
Maria Khoreva (ballet dancer public) · Russian

(Part 5) DOMAIN RANGE FUNGSI AKAR FUNGSI DAN PEMODELANNYA MATEMATIKA TINGKAT LANJUT KELAS 11
Wien Classroom · Indonesian

PENGENALAN ALAT-ALAT LABORATORIUM KIMIA DAN KEAMANAN & KESELAMATAN KERJA (K3) DI LABORATORIUM KIMIA
WIN'S CHEMISTRY CLASS · Indonesian

TERMINOLOGI GIGI | Istilah dalam kedokteran gigi
Dokter Gigi Channel · English

Tutorial Merakit Komputer Sampai Hidup
LKP Sembiring Official · Indonesian

سلسلة الأسى الذكوري 1: ترجمة رسالة ديفيد مورا (علاج إدمان الإباحيات)
Emad Rashad Othman · English
Get the TLDR of any YouTube video
Transcribe, summarize, and repurpose videos in 125+ languages — free, no signup required.