Jailbreak

Jailbreak je technika obcházení bezpečnostních pravidel jazykového modelu s cílem přimět jej k výstupu, který mu byl při zarovnávacím tréninku zapovězen. Od prompt injekce se pojmově liší směřováním: injekce přepisuje zadání zadané provozovatelem aplikace, jailbreak míří na samotné hodnotové mantinely modelu. Metody využívají toho, že bezpečnostní chování je naučené statistické zvyklosti, ne tvrdé pravidlo. Nejběžnější je rámování rolí a fikce, kdy se škodlivý obsah zabalí do hraní postavy, scénáře nebo „hypotetického“ příkladu. Dále se používá postupné navyšování v mnoha krocích, kdy každý dílčí požadavek působí nevinně, přesun do málo zastoupeného jazyka či kódování, jehož bezpečnostní trénink neobsáhl, konflikt instrukcí, nebo automaticky nalezené adversariální řetězce znaků, které chování modelu překlopí bez zjevného významu. Obranou je vícevrstvý přístup: kromě samotného zarovnání ještě nezávislé klasifikátory nad vstupem i výstupem, průběžné červené týmování a omezení dopadu – model, který nemá k dispozici nebezpečné nástroje, může být přemluven k čemukoli s mnohem menšími následky.


Bezpečnostní pravidla modelu nejsou zámek, ale vychování. Model se naučil, že na určité otázky se slušně neodpovídá – podobně jako se vrátný naučil nikoho nepouštět bez průkazu. Jailbreak je sada přesvědčovacích triků na takového vrátného: „já tu nejsem jako návštěva, ale jako herec ve filmu, kde se hraje, že jdu dovnitř“, nebo dvacet malých nevinných žádostí, z nichž až ta poslední otevře dveře. Vrátného lze vycvičit lépe, ale nikdy dokonale. Proto se cenné věci nenechávají za vrátným, ale v trezoru.

Je pro vás článek užitečný a čerpáte z něj? Zkopírujte si citaci