Varje modell är en komprimerad återspegling av vad den utfodrats med. Träningsdata är den kosten: samlingen av exempel som ett maskininlärningssystem studerar innan det ombeds att göra något användbart. En ansiktsigenkänningsmodell kan lära sig av miljontals märkta porträtt. En schackmotor lär sig av miljontals partier. En medicinsk klassificerare lär sig av skanningar som kommenterats av radiologer.
Volymen hjälper, men kompositionen är viktigare. Om porträtten är snedvridna i vitt och manligt, kommer modellen att misslyckas på mörkare hud och kvinnor. Om speldatan endast kommer från amatörspelare, kommer motorn att plana ut. Forskare kallar detta distributionsförskjutning, och det är en av de vanligaste anledningarna till att en modell som ser fantastisk ut i labbet snubblar i det vilda.
Praktiska problem
- Etikettkvalitet: brusiga eller partiska annoteringar förgiftar modellen
- Samtycke och licensiering: webbskrapad data kan medföra juridisk risk
- Sekretess: personlig information måste ofta rengöras eller anonymiseras
- Representation: sällsynta grupper behöver avsiktlig överprovtagning
Rengöring och kurering av data tar vanligtvis upp 60 till 80 procent av ett maskininlärningsprojekts tid. Den spännande delen är arkitekturen; den avgörande delen är datamängden.
Comments
No comments yet. Be the first to share a thought.
Leave a comment