En modell som scorer 99 prosent på treningsdata og 60 prosent på nye data har lært feil lekse. Overtilpasning betyr å memorere støy og særegenheter i stedet for det underliggende mønsteret, og det er den vanligste feilen i anvendt maskinlæring.
Signalene er enkle å få øye på. Treningstapet fortsetter å synke mens valideringstapet øker. Modellen yter bra på eksempler den har sett og dårlig på alt annet. Kompleksitet, små datasett og lang trening øker alle risikoen.
Vanlige mottiltak
- Mer treningsdata
- Regularisering som vekttap
- Frafall under trening
- Tidlig stopp basert på valideringstap
- Enklere modellarkitekturer
- Datautvidelse
Undertilpasning er det motsatte problemet, der modellen er for enkel til å fange mønsteret i det hele tatt. Målet er en mellomting, der modellen generaliserer uten å memorere.
Comments
No comments yet. Be the first to share a thought.
Leave a comment