Hver modell er en komprimert refleksjon av hva den ble matet med. Treningsdata er denne dietten: samlingen av eksempler et maskinlæringssystem studerer før det blir bedt om å gjøre noe nyttig. En ansiktsgjenkjenningsmodell kan lære av millioner av merkede portretter. En sjakkmotor lærer av millioner av spill. En medisinsk klassifikator lærer av skanninger kommentert av radiologer.
Volum hjelper, men komposisjon er viktigere. Hvis portrettene er skjeve i hvitt og mannlig, vil modellen mislykkes på mørkere hud og kvinner. Hvis spilldataene kun kommer fra amatørspillere, vil motoren flate ut. Forskere kaller dette fordelingsskifte, og det er en av de vanligste grunnene til at en modell som ser strålende ut i laboratoriet, snubler i naturen.
Praktiske bekymringer
- Etikettkvalitet: støyende eller partiske annoteringer forgifter modellen
- Samtykke og lisensiering: nettskrapede data kan medføre juridisk risiko
- Personvern: Personopplysninger må ofte skrubbes eller anonymiseres
- Representasjon: sjeldne grupper trenger bevisst oversampling
Rens og kuraterer data bruker vanligvis 60 til 80 prosent av tiden et maskinlæringsprosjekt har. Den glamorøse delen er arkitekturen, den avgjørende delen er datasettet.
Comments
No comments yet. Be the first to share a thought.
Leave a comment