Vægte læres. Hyperparametre vælges. Læringshastighed, batchstørrelse, antal lag, frafaldshastighed og regulariseringsstyrke falder alle ind under denne kategori. De styrer, hvordan træningen forløber, og hvordan modellen er struktureret.
At gøre forkert spilder tid og beregninger. En for høj læringshastighed divergerer. For lave crawls. Batchstørrelse påvirker gradientstøj og hukommelsesforbrug. Dybde og bredde bestemmer kapaciteten, som skal matche opgavens kompleksitet og datastørrelsen.
Almindelige tuningsmetoder
- Gittersøgning over et fast sæt
- Tilfældig søgning efter bredere dækning
- Bayesiansk optimering for effektivitet
- Befolkningsbaseret træning
- Manuel tuning styret af intuition
Justering er dyrt. Hver konfiguration kræver en fuld træningskørsel, og søgeområdet vokser hurtigt. Erfarne praktikere indsnævrer området med domæneviden, før de automatiserer, hvilket ofte slår brute-force-søgning.
Comments (2)
Leave a comment