Wenn ich mit ChatGPT arbeite, fühlt es sich an wie ein Gespräch. Dabei steckt dahinter gar kein Verstehen im menschlichen Sinn, sondern ein Trick: Das Modell sagt Wort für Wort voraus, was als Nächstes kommen müsste. Klingt banal, ist aber die Grundlage für fast alles, was wir heute als generative KI kennen. Ich erkläre hier, wie die Kette dahinter funktioniert – ohne Formeln, dafür mit Beispielen.
Der erste Schritt: Text wird zerlegt
Ein Sprachmodell liest keinen Text wie wir. Es zerlegt alles in kleine Bausteine, die sogenannten Token. Ein Token ist selten ein ganzes Wort – oft ist es eine Silbe oder ein Wortteil. „Künstliche Intelligenz“ wird so zum Beispiel in mehrere Stücke aufgeteilt. Diesen Vorgang nennt man Tokenisierung.
- Token sind die Grundwährung jedes Sprachmodells.
- Kontexte und Antworten werden nach Token gemessen, nicht nach Zeichen.
- Deshalb wirken lange Texte „teuer“: Sie verbrauchen viele Token.
Das eigentliche Geheimnis: Aufmerksamkeit statt Regeln
Die entscheidende Architektur dahinter ist der Transformer, 2017 von Google vorgestellt. Sein Kernstück ist der Aufmerksamkeitsmechanismus (Attention). Er entscheidet bei jedem Token, welche Teile des bisherigen Textes gerade wichtig sind. Frage ich nach „dem Berliner“ und schreibe danach „dem Flughafen“, verbindet das Modell die beiden – ohne feste Regeln, rein über Muster aus den Trainingsdaten.
Selbstaufmerksamkeit: jedes Wort schaut auf jedes Wort
Diese Selbstaufmerksamkeit läuft bei jedem Schritt über den gesamten bereits geschriebenen Kontext. Das klingt nach viel Rechenaufwand, und das ist es auch. Genau darum brauchen große Modelle Unmengen an GPU-Leistung – das sind keine Bauchrechnungen, sondern Millionen von Gewichten, die parallel durchlaufen werden.
Wo die Grenzen liegen
Das ehrliche Bild: Ein Sprachmodell sagt nur das wahrscheinlichste nächste Token voraus. Es hat kein „Wissen“ im engen Sinn, sondern ein statistisches Muster. Deshalb gibt es Halluzinationen: Wenn das Muster ein plausibles, aber falsches Wort vorhersagt, steht es am Ende mit erstaunlicher Selbstsicherheit da.
- Es kann sich verschätzen – gerade bei Zahlen und exakten Fakten.
- Das Kontextfenster begrenzt, wie viel es auf einmal „sieht“.
- Je spezifischer die Frage, desto öfter klafft eine Wissenslücke.
Mein Fazit
Ich finde es beruhigend zu wissen, was unter der Haube steckt. Sobald man versteht, dass es um Wahrscheinlichkeiten und Muster geht, nutzt man die Werkzeuge anders: Man fragt präziser, prüft kritisch und nimmt selbstbewusste Antworten nicht für bare Münze. Das ist kein Technik-Bashing, sondern einfach kluger Umgang mit einem sehr starken, aber blinden Werkzeug.