Ponderile sunt învățate. Hiperparametrii sunt aleși. Rata de învățare, dimensiunea lotului, numărul de straturi, rata de abandon și puterea de regularizare se încadrează toate în această categorie. Acestea controlează modul în care decurge antrenamentul și modul în care este structurat modelul.
Dacă le înțelegi greșit, irosești timp și resurse de calcul. O rată de învățare prea mare duce la divergențe. O rată de învățare prea mică duce la crawl-uri. Dimensiunea lotului afectează zgomotul gradientului și utilizarea memoriei. Adâncimea și lățimea determină capacitatea, care trebuie să corespundă complexității sarcinii și dimensiunii datelor.
Metode comune de reglare
- Căutare în grilă pe un set fix
- Căutare aleatorie pentru o acoperire mai largă
- Optimizare bayesiană pentru eficiență
- Instruire bazată pe populație
- Reglare manuală ghidată de intuiție
Reglarea este costisitoare. Fiecare configurație necesită o rulare completă de antrenament, iar spațiul de căutare crește rapid. Practicienii experimentați restrâng spațiul cu cunoștințe de domeniu înainte de automatizare, ceea ce adesea depășește căutarea prin forță brută.
Comments (2)
Leave a comment