Každý model je komprimovaným odrazem toho, co byl krmen. Trénovací data jsou touto stravou: souborem příkladů, které systém strojového učení studuje, než je požádán o cokoli užitečného. Model rozpoznávání obličeje se může učit z milionů popsaných portrétů. Šachový engine se učí z milionů partií. Lékařský klasifikátor se učí ze skenů anotovaných radiology.
Objem pomáhá, ale kompozice je důležitější. Pokud jsou portréty zkreslené bělochy a muži, model selže na tmavší pleti a ženách. Pokud herní data pocházejí pouze od amatérských hráčů, vyhledávač se ustálí. Vědci to nazývají posun v distribuci a je to jeden z nejčastějších důvodů, proč model, který v laboratoři vypadá skvěle, v reálném čase selhává.
Praktické obavy
- Kvalita popisků: zašuměné nebo zkreslené anotace kazí model
- Souhlas a licencování: data získaná z webu mohou nést právní riziko
- Soukromí: osobní údaje musí být často vymazány nebo anonymizovány
- Reprezentace: vzácné skupiny vyžadují záměrné převzorkování
Čištění a kurátorství dat obvykle spotřebuje 60 až 80 procent času projektu strojového učení. Nejzajímavější je architektura, rozhodující je datová sada.
Comments
No comments yet. Be the first to share a thought.
Leave a comment