Perplexita (perplexity)

Perplexita je nejrozšířenější metrika kvality jazykových modelů, definovaná jako exponenciála průměrné křížové entropie na token. Interpretuje se jako vážený průměrný počet možností, mezi nimiž model v každém kroku váhá: perplexita deset znamená, že model je při volbě dalšího tokenu stejně nejistý, jako by vybíral rovnoměrně z deseti kandidátů. Nižší hodnota je tedy lepší a dolní hranicí je jednička, tedy dokonalá předpověď. Protože jde o přímou funkci ztrátové funkce použité při předtrénování, sleduje se perplexita v průběhu tréninku jako hlavní ukazatel pokroku a je základní veličinou v zákonech škálování. Má však dvě zásadní omezení. Hodnoty nejsou srovnatelné mezi modely s odlišnou tokenizací ani mezi různými korpusy, takže absolutní číslo bez kontextu nic neříká. A především nízká perplexita neznamená užitečnost: model může být výborný v předpovídání textu, a přesto neposlušný, nepravdivý nebo nebezpečný. Proto ji dnes doplňují úlohové benchmarky a lidské hodnocení.


Perplexita je míra překvapení. Představte si, že hádáte další slovo v cizí větě. Máte-li perplexitu dva, znamená to, že se vždycky rozhodujete mezi dvěma slovy – textu rozumíte výborně. Máte-li perplexitu tisíc, tápete jako v jazyce, který jste nikdy neslyšeli. Číslo tedy říká, jak moc vás text ještě dokáže zaskočit. Pozor ale na to, co neříká: člověk, který dokonale předvídá, co bude v novinách napsáno, ještě nemusí být dobrý rádce. Předvídat a být užitečný jsou dvě různé schopnosti.

Je pro vás článek užitečný a čerpáte z něj? Zkopírujte si citaci