Wenn ich jemandem erkläre, was hinter ChatGPT, Claude oder Gemini steckt, kommt meist zuerst der Satz: „Die haben doch das ganze Internet gelesen.“ Das stimmt grob, aber es führt in die Irre. Ein Sprachmodell ist keine Datenbank mit Wissen, die bei Fragen nachschlägt. Es ist ein Gerät, das Wort für Wort errät, was als Nächstes kommen könnte. Diesen Unterschied zu verstehen, ändert, wie man mit KI arbeitet.
Tokens: Die Bausteine, mit denen ein Modell rechnet
Ein Sprachmodell liest keinen Text wie du und ich, Buchstabe für Buchstabe und Wort für Wort. Es zerlegt alles in Tokens – das sind Wortbausteine. Ein häufiges Wort wie „Haus“ ist oft ein einzelner Token, ein langes oder seltenes Wort wird in mehrere Stücke gespalten. Ungefähr 750 englische Wörter entsprechen 1.000 Tokens, bei Deutsch ähnelt das.
- Tokens sind die kleinste Einheit, mit der ein Modell rechnet.
- Die Länge einer Eingabe wird in Tokens gemessen, nicht in Zeichen.
- Deshalb ist die Fenstergröße eines Modells („128k Kontext“) eine Token-Zahl.
Das eigentliche Prinzip: das nächste Token vorhersagen
Beim Training zeigt man dem Modell riesige Mengen Text – aus Büchern, Webseiten, Foren, Dokumentationen. Die Aufgabe ist simpel: Sag das nächste Token voraus. Aus zig Milliarden Beispielen entstehen dabei statistische Muster, welche Wörter in welchem Zusammenhang wahrscheinlich folgen. Das Fraunhofer IESE beschreibt das treffend: Nachdem das Modell für alle möglichen nächsten Tokens eine Wahrscheinlichkeit berechnet hat, wählt eine Dekodierungsstrategie aus, welches Token ausgegeben wird.
Wenn ich „Die Katze sitzt auf der…“ tippe, ist „Fensterbank“ wahrscheinlicher als „Gabel“. So entsteht Text – jeweils ein Token nach dem anderen, immer auf Basis des bisher Geschriebenen.
Warum das so mächtig ist: Muster aus Milliarden Texten
Was aus diesem simplen Prinzip entsteht, ist trotzdem beeindruckend. Weil das Modell Muster aus enorm vielen Texten gelernt hat, kann es:
- Zusammenfassen, Übersetzen und Code schreiben, ohne dafür eine feste Programmregel zu haben.
- Auf Zusammenhänge im Gespräch reagieren, weil alles Bisherige Teil der Vorhersage-Grundlage wird.
- Stil nachahmen – von sachlich bis frech, je nachdem, wie die Muster es wahrscheinlich machen.
Was mich dabei immer wieder überrascht: Ein System, das nur „was kommt als Nächstes?“ übt, bringt dadurch Fähigkeiten hervor, die wie Verstehen aussehen. Es ist aber kein echtes Verstehen im menschlichen Sinn – es gibt keine Ahnung von Wahrheit, Absicht oder Welt. Nur sehr gute Muster.
Was das für deinen Alltag mit KI bedeutet
Aus diesem Prinzip folgen drei praktische Regeln:
- Prüfe Fakten nach. Das Modell gibt wahrscheinliche, nicht verifizierte Antworten.
- Gib Kontext. Je mehr passende Vorgeschichte im Fenster liegt, desto bessere Vorhersagen.
- Frag nach Quellen und Begründungen. Das zwingt das Modell in Muster, die eher stimmen.
Wer KI als sehr schnellen, sehr belesenen Formulierer sieht – statt als allwissende Maschine –, macht weniger Fehler und bekommt bessere Ergebnisse. Die Technik dahinter ist kein Zauber, aber sie bleibt ein cleverer Trick: Wahrscheinlichkeit wird zu Sprache.