En model, der scorer 99 procent på træningsdata og 60 procent på nye data, har lært den forkerte lektie. Overfitting betyder at huske støj og særheder i stedet for det underliggende mønster, og det er den mest almindelige fejl i anvendt maskinlæring.
Signalerne er lette at få øje på. Træningstabet falder fortsat, mens valideringstabet stiger. Modellen klarer sig godt på de eksempler, den har set, og dårligt på alt andet. Kompleksitet, små datasæt og lang træning øger alle risikoen.
Almindelige modforanstaltninger
- Flere træningsdata
- Regularisering såsom vægttab
- Frafald under træning
- Tidlig stopning baseret på valideringstab
- Enklere modelarkitekturer
- Dataforøgelse
Undertilpasning er det modsatte problem, hvor modellen er for simpel til overhovedet at indfange mønsteret. Målet er en mellemvej, hvor modellen generaliserer uden at huske.
Comments
No comments yet. Be the first to share a thought.
Leave a comment