LoRA (Low-Rank Adaptation) je metoda parametricky úsporného doladění velkých modelů. Vychází z pozorování, že změna vah potřebná k adaptaci předtrénovaného modelu na konkrétní úlohu má nízkou vnitřní hodnost, a lze ji tedy dobře aproximovat součinem dvou úzkých matic. Původní váhová matice se zmrazí a k jejímu výstupu se přičte korekce ve tvaru součinu matic A a B, kde sdílený vnitřní rozměr r bývá jen jednotky až desítky – oproti tisícům u původní matice. Trénují se pouze tyto adaptéry, což typicky představuje méně než jedno procento parametrů modelu; výrazně tím klesá spotřeba paměti pro optimalizátor i gradienty. Vliv adaptéru se škáluje poměrem alfa ku r. Adaptéry se vkládají zejména do projekcí dotazu a hodnoty v mechanismu pozornosti. Po tréninku je lze buď sloučit zpět do vah bez jakéhokoli zpomalení inference, nebo je držet odděleně a přepínat mezi mnoha specializacemi nad jedním sdíleným základem. Kombinace s kvantizovaným základním modelem je známa jako QLoRA.
Nemusíte přestavovat celý obchod, aby vypadal vánočně – stačí do výlohy nalepit fólii. Základní budova zůstává beze změny, fólie váží pár gramů, po svátcích ji sundáte a nalepíte velikonoční. LoRA je přesně taková fólie přes obrovský model: samotný model má stovky gigabajtů a nikdo ho kvůli jedné firmě nebude přetrénovávat, ale adaptér o velikosti pár desítek megabajtů dokáže jeho tón a odbornost posunout tam, kam potřebujete. A protože je fólií možné mít v šuplíku dvacet, může jeden model obsluhovat právní oddělení, podporu i marketing – každé se svou vlastní.