CLIP, das Modell, das in vielen Bildgeneratoren Bilder und Text verbindet, liest Sprache über ein Wörterbuch von rund 49.000 Token. Ausgehend von einem Stockfoto einer Meereshöhle hat ein genetischer Algorithmus über zweihundert Generationen (Population 2048) sechzehn Token gezüchtet und dabei behalten, was CLIP näher am Bild bewertete.
email, defeats, wallart, cave, impacting, pi, peoplesvote, blames, mcclure, 👣, croati, desk, zazzle, numerous, mediter, eleng
Fragmente wie croati und mediter beenden ihre Wörter nie, und doch zeichnen Bildmodelle, die an der Suche nicht beteiligt waren, daraus eine Höhle. Die Token-IDs werden jedem Modell direkt übergeben, ohne den Schritt, in dem ein geschriebener Prompt in Token zerlegt würde. Die Arbeit liest solche Folgen als Poesie, die für eine Maschine geschrieben ist: Wir sind nicht die Adressat*innen, wir belauschen sie nur.
Wie nah kommt eine Beschreibung dem Foto?
CLIP-Ähnlichkeit zwischen dem Zielfoto und fünf Beschreibungen:
(fauler) Mensch, „a photo of a cave and the ocean“: 0,272
die sechzehn Token: 0,433
ChatGPT: 0,258
JoyCaption Beta One: 0,271
Gemini: 0,273
Weil genau dieser Wert vom Algorithmus maximiert wurde, zählt vor allem die Übertragung auf die anderen Modelle.
Stand
Vorarbeit, erstmals als „Prompt Reconstruction“ im Vortrag 51 Ways to Spell the Image Giraffe auf dem 39C3 in Hamburg 2025 gezeigt. Die Arbeit befindet sich in Entwicklung.
Artists and developers: Ting-Chun Liu, Leon-Etienne Kühr
Target photograph: Stefan Kunze / Unsplash
Four-image grid, row by row: FLUX.1-dev, Stable Diffusion 3.5 medium, Stable Diffusion XL, Stable Diffusion 1.5