Křížová pozornost (cross-attention) je varianta mechanismu pozornosti, v níž dotazy pocházejí z jedné sekvence, zatímco klíče a hodnoty z jiné. Tím se liší od sebepozornosti (self-attention), kde všechny tři projekce vycházejí ze téhož vstupu. V klasické architektuře typu encoder-decoder umožňuje křížová pozornost dekodéru, aby se při generování každého výstupního tokenu „podíval“ na celou reprezentaci vstupu vytvořenou enkodérem a vybral si z ní právě to, co v daném okamžiku potřebuje. Historicky právě tohle vyřešilo úzké hrdlo strojového překladu, kde se dříve celá zdrojová věta musela stlačit do jediného kontextového vektoru. Dnes je křížová pozornost základním nástrojem multimodálních modelů: textový dekodér přes ni čte reprezentaci obrázku, zvuku či videa. Používají ji i difuzní modely pro generování obrázků, kde odšumovací síť přes křížovou pozornost přihlíží k embeddingu textového promptu, a tím se výsledný obraz řídí zadáním.
Představte si tlumočníka, který převádí projev do jiného jazyka. Nezapamatuje si celou řeč a nepřeloží ji poslepu; má před sebou zapsané poznámky mluvčího a při každém slově, které vysloví, do nich cíleně nahlédne – teď na jméno, teď na číslo, teď na ten složitý termín. Poznámky jsou jedna sekvence, jeho vlastní řeč druhá, a pohled mezi nimi je právě křížová pozornost. Stejným způsobem model popisující fotografii při každém dalším slově kouká na jinou část obrázku: u slova „pes“ na zvíře, u slova „tráva“ na pozadí.