Vikter lärs in. Hyperparametrar väljs. Inlärningshastighet, batchstorlek, antal lager, bortfallsfrekvens och regulariseringsstyrka faller alla inom denna kategori. De styr hur träningen fortskrider och hur modellen struktureras.
Att göra fel slösar tid och beräkningsförmåga. En för hög inlärningshastighet leder till divergeringar. För låga crawlningar. Batchstorlek påverkar gradientbrus och minnesanvändning. Djup och bredd avgör kapaciteten, som måste matcha uppgiftens komplexitet och datastorleken.
Vanliga inställningsmetoder
- Rutnätssökning över en fast mängd
- Slumpmässig sökning för bredare täckning
- Bayesiansk optimering för effektivitet
- Befolkningsbaserad utbildning
- Manuell inställning vägledd av intuition
Justering är dyrt. Varje konfiguration kräver en fullständig träningskörning, och sökområdet växer snabbt. Erfarna utövare begränsar området med domänkunskap innan de automatiserar, vilket ofta slår brute-force-sökning.
Comments (2)
Leave a comment