Drift dat a konceptu

Drift označuje postupnou změnu statistických vlastností dat po nasazení modelu, kvůli níž jeho kvalita v čase klesá, přestože se sám model nijak nezměnil. Rozlišují se dva druhy. Drift dat (též kovariátní posun) znamená změnu rozdělení vstupních příznaků – změní se struktura zákazníků, přejde se na jiný typ senzoru, otevře se nový trh –, přičemž vztah mezi příznaky a cílem zůstává. Drift konceptu je vážnější: mění se samotný vztah mezi vstupem a výstupem, takže dřívější zákonitost přestává platit. Klasickými příklady jsou chování zákazníků po ekonomickém šoku, změna taktiky podvodníků reagujících na detekci nebo posun významu slov. Podle rychlosti může být drift náhlý, postupný, inkrementální i opakující se sezónně. Detekce probíhá buď sledováním chyby proti postupně dostupným skutečným výsledkům, nebo – nejsou-li k dispozici – statistickým srovnáváním rozdělení pomocí testů a indexů typu PSI. Reakcí je přetrénování na aktuálních datech, klouzavé okno nebo online učení, vždy ale s ohledem na zapomínání. Monitoring driftu je proto nedílnou součástí provozu, nikoli volitelnou nadstavbou.


Představte si mapu města, kterou jste si nakreslili před deseti lety a od té doby jí bezvýhradně věříte. Zpočátku funguje. Pak vznikne nová čtvrť – to je drift dat, jezdíte po místech, která na mapě nejsou. A jednoho dne zavedou ve starém centru jednosměrky opačným směrem – to je drift konceptu, protože teď vás mapa aktivně vede špatně. Nepomůže vám, že jste ji nakreslili pečlivě. Musíte prostě vyjít a nakreslit ji znovu, a hlavně musíte mít někoho, kdo hlídá, že se město mění.

Je pro vás článek užitečný a čerpáte z něj? Zkopírujte si citaci