圖像模型讀的不是文字,而是 token(詞元):來自一本固定字典的字詞碎片。許多圖像模型背後的文字編碼器 CLIP,字典裡約有 49,000 個 token,而「giraffe」這個字可以用它拼出 51 種寫法,從單一的 token giraffe,一直到 g|i|r|a|f|f|e。
把這些拼法直接送進模型,多數仍然畫出長頸鹿,有些則漂向大象或馬。在任何訓練之前,字典就已經決定了什麼能被畫出來,有些圖像甚至因為字典被「清理」過而根本無法被提示出來。
這本字典由 Byte Pair Encoding 建成:從網路爬取的文字中,最常出現的字元組合被一次又一次合併。品牌名稱、平台用語與主題標籤因此成為單一 token,較少見或非英文的字詞則被拆成長長一串碎片。這項研究把這個隱藏的層次當作素材,並在《Sixteen Tokens for a Cave》中把它變成一種書寫方式。
講演
《51 Ways to Spell the Image Giraffe: The Hidden Politics of Token Languages in Generative AI》,第 39 屆混沌通訊大會(39C3),漢堡,2025 年 12 月,與 Leon-Etienne Kühr 合作。錄影可在 media.ccc.de 觀看。
研究開發中。
Talk and research: Ting-Chun Liu, Leon-Etienne Kühr
Images: slides from the talk, 39C3, 2025; photograph of the speakers: still from the recording, media.ccc.de, CC BY 4.0