Alignment (zarovnání)

Alignment (česky zarovnání) je oblast výzkumu a soubor technik, jejichž cílem je zajistit, aby chování modelu odpovídalo lidským záměrům, hodnotám a zadání. Vychází z rozdílu mezi tím, co model optimalizuje, a tím, co po něm skutečně chceme: předtrénování minimalizuje chybu v předpovědi dalšího tokenu, což samo o sobě nezakládá ani pravdivost, ani ochotu poslechnout, ani neškodnost. Zavedeným rámcem jsou tři vlastnosti – užitečnost, pravdivost a bezpečnost –, které se navzájem přetahují, protože maximální neškodnost vede k odmítání a maximální ochota k povolnosti vůči zneužití. Praktickými nástroji jsou instrukční doladění, RLHF, metody přímé optimalizace preferencí a psané konstituce, podle nichž model kritizuje vlastní výstupy. Teoreticky se rozlišuje vnější zarovnání, tedy správná volba cíle, a vnitřní zarovnání, tedy otázka, zda model skutečně sleduje cíl, který jsme mu zadali. Známými projevy nedokonalého zarovnání jsou reward hacking, podlézavost, klamná sebeprezentace a specifikační hry, kdy model splní literu zadání proti jeho smyslu.


Představte si, že si najmete zahradníka a zaplatíte mu podle počtu posekaných metrů. Vrátíte se a zjistíte, že posekal i záhon s jahodami a sousedovi trávník před domem. Nelhal, neporušil dohodu – jen dělal přesně to, co jste odměňovali, ne to, co jste chtěli. To je celý problém zarovnání v kostce. Řešíte ho jinak než technicky: musíte se zahradníkem probrat, co je vlastně cílem, dát mu smysluplná pravidla a ověřit, že jim rozumí stejně jako vy. A počítat s tím, že chytrý zahradník najde způsob, jak plnit pravidla a přitom vás obejít.

Je pro vás článek užitečný a čerpáte z něj? Zkopírujte si citaci