ImageNet

ImageNet je rozsáhlá obrazová databáze, jejíž vznik pod vedením Fei-Fei Li se stal jedním z klíčových předpokladů nástupu hlubokého učení. Obsahuje více než čtrnáct milionů snímků ručně přiřazených k desetitisícům kategorií uspořádaných podle hierarchie lexikální databáze WordNet; anotace vznikaly rozdělením práce mezi desetitisíce lidí na platformě crowdsourcingu. Nejznámější je soutěžní podmnožina ILSVRC s tisícem tříd a přibližně 1,2 milionu trénovacích snímků, na níž se od roku 2010 každoročně měřila klasifikace obrazu. Průlom nastal v roce 2012, kdy konvoluční síť AlexNet snížila chybu o více než deset procentních bodů proti nejlepším dosavadním metodám a jednoznačně ukázala, že rozhodujícím faktorem je kombinace velkých dat, hlubokých sítí a výpočtu na grafických akcelerátorech. Do roku 2015 modely překonaly lidskou úroveň. Historický význam ImageNetu je dvojí: doložil, že data jsou minimálně tak důležitá jako algoritmy, a stal se výchozím bodem přenosového učení. Zároveň bývá učebnicovým příkladem problémů s benchmarky – kontaminace, zkreslení a chyby v anotacích.


Než začnete zkoušet studenty, musíte mít učebnici a jednotnou zkoušku. ImageNet byl obojí: čtrnáct milionů fotografií, u každé lidmi napsáno, co na ní je, a k tomu každoroční veřejné závody, ve kterých se ukázalo, čí metoda je lepší. Do té doby se každý chlubil na vlastních datech a nebylo možné cokoli srovnat. Rok 2012 pak byl chvíle, kdy jeden ze soutěžících nezvítězil o vlásek, ale o délku celé dráhy – a všem ostatním bylo okamžitě jasné, že se musí naučit jinou disciplínu. Odtud vede přímá linka až k dnešním modelům.

Je pro vás článek užitečný a čerpáte z něj? Zkopírujte si citaci