Bildmodelle lesen keine Wörter, sie lesen Token: Bruchstücke aus einem festen Wörterbuch. Das Wörterbuch von CLIP, dem Text-Encoder hinter vielen Bildmodellen, enthält rund 49.000 davon, und das Wort „giraffe“ lässt sich daraus auf 51 Arten buchstabieren, vom einzelnen Token giraffe bis zu g|i|r|a|f|f|e.
Direkt in das Modell gegeben, zeichnen die meisten dieser Schreibweisen trotzdem eine Giraffe; einige driften zu einem Elefanten oder einem Pferd. Noch vor jedem Training entscheidet das Wörterbuch also mit, was sich abbilden lässt, und manche Bilder lassen sich gar nicht erst abrufen, weil das Wörterbuch bereinigt wurde.
Das Wörterbuch entsteht durch Byte Pair Encoding: Die häufigsten Zeichenpaare in aus dem Netz gesammelten Texten werden immer wieder zusammengeführt. Markennamen, Plattform-Slang und Hashtags werden so zu einzelnen Token, während seltenere oder nicht englische Wörter in lange Ketten von Fragmenten zerfallen. Die Forschung behandelt diese verborgene Schicht als Material und macht sie in Sixteen Tokens for a Cave zu einer Form des Schreibens.
Vortrag
51 Ways to Spell the Image Giraffe: The Hidden Politics of Token Languages in Generative AI, 39. Chaos Communication Congress (39C3), Hamburg, Dezember 2025, mit Leon-Etienne Kühr. Die Aufzeichnung ist auf media.ccc.de zu sehen.
Die Forschung befindet sich in Entwicklung.
Talk and research: Ting-Chun Liu, Leon-Etienne Kühr
Images: slides from the talk, 39C3, 2025; photograph of the speakers: still from the recording, media.ccc.de, CC BY 4.0