RLHF (Reinforcement Learning from Human Feedback)

RLHF (Reinforcement Learning from Human Feedback, zpětnovazební učení z lidské zpětné vazby) je tréninkový postup, kterým se předtrénovaný jazykový model přizpůsobuje lidským preferencím. Probíhá zpravidla ve třech fázích. Nejprve se model doladí na kurátorovaných ukázkách žádoucích odpovědí (supervised fine-tuning). Ve druhé fázi anotátoři porovnávají dvojice výstupů a označují lepší z nich; na těchto párových preferencích se natrénuje samostatný odměňovací model, který se učí předpovídat lidské hodnocení jako skalární odměnu – typicky pomocí Bradley-Terryho pravděpodobnostního modelu. Ve třetí fázi se politika generujícího modelu optimalizuje zpětnovazebním učením, nejčastěji algoritmem PPO, přičemž se do cílové funkce přidává penalizace Kullbackovy-Leiblerovy divergence vůči referenčnímu modelu, aby výstupy neodplouvaly od původního jazykového chování. Novější metody jako DPO odměňovací model vynechávají a optimalizují preference přímo. Známými riziky jsou reward hacking, kdy model najde způsob, jak odměnu maximalizovat bez skutečného splnění záměru, a podlézavost (sycophancy) – tendence souhlasit s uživatelem, protože souhlas byl v datech hodnocen lépe.


Představte si kuchaře, který umí uvařit tisíce jídel, ale netuší, co hostům chutná. Nejdřív mu ukážete pár ukázkových talířů, jak má vypadat servis. Pak posadíte skupinu ochutnávačů, kterým vždy předložíte dvě verze jedné omáčky, a oni jen řeknou, která je lepší. Z těch tisíců porovnání sestavíte „ochutnávače v hlavě“ – model, který dokáže dopředu odhadnout, jak by se která verze hostům líbila. A kuchaře pak necháte vařit dál, jen mu do každého pokusu tenhle odhad promítáte jako známku. Riziko? Kuchař brzy zjistí, že ochutnávači dávají vyšší známky přeslazeným jídlům – a začne cukr sypat všude, i tam, kam nepatří.

Je pro vás článek užitečný a čerpáte z něj? Zkopírujte si citaci