Træningsdata underviser i en maskinlæringsmodel. Modellen ser eksempler og lærer forholdet mellem input og output. For et spamfilter er træningsdataene e-mails mærket spam eller ikke spam. For en billedklassifikator er det fotos mærket med deres indhold. For en sprogmodel er det enorme mængder tekst. Modellen justerer sine interne parametre for at minimere forskellen mellem dens forudsigelser og de korrekte etiketter. Kvaliteten og mængden af træningsdata bestemmer, hvor godt modellen præsterer.
Træningsdata har flere krav. De skal være repræsentative for de data fra den virkelige verden, som modellen vil støde på. En model, der kun er trænet på dagsbilleder, fejler på natbilleder. De skal mærkes nøjagtigt. Forkert mærkede eksempler lærer modellen forkerte mønstre. De skal være store nok til at indfange variationen i dataene. For lidt data fører til overfitting, hvor modellen husker træningseksemplerne i stedet for at lære generelle mønstre. De skal være fri for bias, ellers vil modellen lære og forstærke denne bias. Træningsdata er også en bekymring for privatlivets fred. Modeller, der er trænet på personoplysninger, kan huske og reproducere dem. Reguleringsrammer kræver i stigende grad dokumentation af træningsdatakilder og -behandling. Dataene er ikke bare et input. De er en forpligtelse og et aktiv. Modellen er kun så god som de data, den har lært af.
Krav til træningsdata
- Repræsentativ — afspejler variation i den virkelige verden
- Mærket — nøjagtig sandhed på jorden
- Store eksempler – nok til at generalisere
- Upartisk — ingen systematisk skævhed
- Dokumenteret — oprindelse og forarbejdning kendt
Træningsdata er læreren. Modellen lærer, hvad dataene viser. Dårlige data giver dårlige lektioner.
Comments
No comments yet. Be the first to share a thought.
Leave a comment