En modell som får 99 procent på träningsdata och 60 procent på ny data har lärt sig fel läxa. Överanpassning innebär att memorera brus och egenheter istället för det underliggande mönstret, och det är det vanligaste misslyckandet inom tillämpad maskininlärning.
Signalerna är lätta att upptäcka. Träningsförlusten fortsätter att minska medan valideringsförlusten ökar. Modellen presterar bra på exempel den har sett och dåligt på allt annat. Komplexitet, små datamängder och lång träning ökar alla risken.
Vanliga motåtgärder
- Mer träningsdata
- Regularisering såsom viktminskning
- Avhopp under träning
- Tidigt stopp baserat på valideringsförlust
- Enklare modellarkitekturer
- Dataökning
Underanpassning är det motsatta problemet, där modellen är för enkel för att fånga mönstret överhuvudtaget. Målet är en medelväg, där modellen generaliserar utan att memorera.
Comments
No comments yet. Be the first to share a thought.
Leave a comment