Każdy model jest skompresowanym odbiciem tego, czym został nakarmiony. Dane treningowe to właśnie ta dieta: zbiór przykładów, które system uczenia maszynowego analizuje, zanim zostanie poproszony o wykonanie czegokolwiek użytecznego. Model rozpoznawania twarzy może uczyć się z milionów opisanych portretów. Silnik szachowy uczy się z milionów partii. Klasyfikator medyczny uczy się ze skanów opatrzonych adnotacjami radiologów.
Objętość ma znaczenie, ale kompozycja ma większe znaczenie. Jeśli portrety są przesunięte w stronę bieli i mężczyzn, model nie sprawdzi się w przypadku ciemniejszej karnacji i kobiet. Jeśli dane z gry pochodzą wyłącznie od graczy-amatorów, silnik osiągnie plateau. Naukowcy nazywają to przesunięciem rozkładu i jest to jeden z najczęstszych powodów, dla których model, który wygląda świetnie w laboratorium, nie sprawdza się w praktyce.
Praktyczne obawy
- Jakość etykiet: zakłócone lub stronnicze adnotacje zatruwają model
- Zgoda i licencja: dane zbierane z sieci mogą wiązać się z ryzykiem prawnym
- Prywatność: dane osobowe często muszą być usuwane lub anonimizowane
- Reprezentacja: rzadkie grupy wymagają celowego nadpróbkowania
Czyszczenie i selekcja danych zazwyczaj pochłania od 60 do 80 procent czasu projektu uczenia maszynowego. Najważniejsza jest architektura; decydującą częścią jest zbiór danych.
Comments
No comments yet. Be the first to share a thought.
Leave a comment