Hver model er en komprimeret afspejling af, hvad den blev fodret med. Træningsdata er denne kost: samlingen af eksempler, som et maskinlæringssystem studerer, før det bliver bedt om at gøre noget nyttigt. En ansigtsgenkendelsesmodel kan lære af millioner af mærkede portrætter. En skakmaskine lærer af millioner af spil. En medicinsk klassifikator lærer af scanninger, der er kommenteret af radiologer.
Lydstyrke hjælper, men kompositionen betyder mere. Hvis portrætterne er skæve, hvide og mandlige, vil modellen fejle på mørkere hud og kvinder. Hvis spildataene kun kommer fra amatørspillere, vil motoren stagnere. Forskere kalder dette distributionsskift, og det er en af de mest almindelige årsager til, at en model, der ser fantastisk ud i laboratoriet, snubler i naturen.
Praktiske bekymringer
- Etiketkvalitet: Støjende eller forudindtagede annotationer forgifter modellen
- Samtykke og licensering: Webskrabede data kan indebære juridisk risiko
- Privatliv: Personlige oplysninger skal ofte slettes eller anonymiseres
- Repræsentation: sjældne grupper kræver bevidst oversampling
Rensning og kuratering af data bruger typisk 60 til 80 procent af et maskinlæringsprojekts tid. Den glamourøse del er arkitekturen; den afgørende del er datasættet.
Comments
No comments yet. Be the first to share a thought.
Leave a comment