Mixture of Experts (MoE)

Mixture of Experts (MoE, směs expertů) je architektonický vzor, v němž je hustá dopředná vrstva transformeru nahrazena množinou paralelních podsítí – expertů – a malou směrovací sítí (router, gating), která pro každý token zvlášť vybere jen několik z nich. Aktivuje se tedy typicky dva experti z osmi, šestnácti nebo stovek, zatímco zbytek zůstává nečinný. Tím se rozchází celkový počet parametrů modelu s počtem parametrů skutečně použitých při jednom průchodu: model může mít stovky miliard vah, ale výpočetní náklad odpovídá jen zlomku z nich. Router je trénován společně se zbytkem sítě a k jeho ztrátové funkci se přidává vyvažovací člen, který brání tomu, aby se veškerý provoz sléval do několika oblíbených expertů a ostatní zůstávaly nevyužité. Praktickým omezením není výpočet, ale paměť – všichni experti musí být načteni, i když se většina nepoužije, což vede k distribuci napříč více akcelerátory. Přístup zpopularizovaly modely Switch Transformer a Mixtral, dnes je základem většiny špičkových jazykových modelů.


Představte si velkou nemocnici. Na příjmu sedí sestra, která s pacientem nestráví víc než půl minuty – jen odhadne, o co jde, a pošle ho ke dvěma správným specialistům. Nemocnice zaměstnává sto lékařů, ale na jednoho pacienta jich pracuje dvojice. Kdyby měl každého pacienta vyšetřit celý tým, byla by péče nesmírně drahá a pomalá. Takhle má nemocnice obrovskou souhrnnou odbornost, ale náklady na jedno ošetření zůstávají nízké. Nevýhoda je zřejmá: všech sto lékařů musí být v budově a dostávat plat, i když většina z nich zrovna daného pacienta nevidí.

Je pro vás článek užitečný a čerpáte z něj? Zkopírujte si citaci