CLIP (Contrastive Language-Image Pre-training) je model představený v roce 2021, který natrénoval společný reprezentační prostor pro obraz a text. Skládá se ze dvou enkodérů – obrazového a textového –, jež svůj vstup promítají do téhož latentního prostoru. Trénink je kontrastní a mimořádně jednoduchý: v dávce několika set milionů párů snímku a jeho popisku model maximalizuje kosinovou podobnost odpovídajících si dvojic a minimalizuje podobnost všech nesprávných kombinací. Zásadní je, že tréninkovým signálem jsou volně dostupné popisky z internetu, ne ručně anotované kategorie, což umožnilo bezprecedentní rozsah dat. Výsledkem je schopnost zero-shot klasifikace: novou úlohu lze definovat prostě tím, že se napíšou textové popisy tříd a vybere se ten, jehož embedding je snímku nejblíž – bez jediného trénovacího příkladu a bez doladění. CLIP se stal páteří moderní multimodality: slouží jako textový podmiňovací modul difuzních modelů pro generování obrázků, jako vizuální enkodér multimodálních jazykových modelů a jako nástroj sémantického vyhledávání v obrazových archivech.
Představte si dvojjazyčný slovník, ve kterém jsou na jedné straně věty a na druhé fotografie – a obojí je přeloženo do jednoho společného, umělého jazyka souřadnic. Věta „pruhovaná kočka na okně“ i skutečná fotografie takové kočky se v tom jazyce zapíšou téměř identicky. Jakmile tohle máte, dokážete najít obrázek podle popisu i popis podle obrázku, aniž byste kdy vytvářeli seznam kategorií. A hlavně můžete přijít s kategorií, o které jste dřív nemluvili – třeba „výrobek s odloupnutým lakem“ – a systém ji rozpozná, protože rozumí popisu, ne seznamu.