Vekter læres. Hyperparametere velges. Læringshastighet, batchstørrelse, antall lag, frafallshastighet og regulariseringsstyrke faller alle inn under denne kategorien. De styrer hvordan treningen forløper og hvordan modellen er strukturert.
Å gjøre feil sløser med tid og databehandling. En for høy læringshastighet divergerer. For lave kravlesøk. Batchstørrelse påvirker gradientstøy og minnebruk. Dybde og bredde bestemmer kapasiteten, som må samsvare med oppgavens kompleksitet og datastørrelsen.
Vanlige tuningsmetoder
- Rutenettsøk over et fast sett
- Tilfeldig søk etter bredere dekning
- Bayesiansk optimalisering for effektivitet
- Befolkningsbasert opplæring
- Manuell tuning styrt av intuisjon
Justering er dyrt. Hver konfigurasjon krever en full treningsrunde, og søkeområdet vokser raskt. Erfarne utøvere begrenser området med domenekunnskap før de automatiserer, noe som ofte slår brute-force-søk.
Comments (2)
Leave a comment