Imaginează-ți că cobori un deal încețoșat, simți panta sub picioare și pășești în direcția care coboară. Coborârea gradientului face același lucru cu o funcție de atenuare a pantei. Calculează panta, face un pas și repetă procesul până când atenuarea nu se mai ameliorează.
Rata de învățare controlează dimensiunea pasului. Dacă este prea mare, se depășește minimul. Dacă este prea mică, antrenamentul durează o veșnicie. Momentum, Adam și alți optimizatori adaptează rata în timpul antrenamentului pentru a accelera convergența.
Variante comune
- Coborâre în gradient în lot folosind toate datele
- Coborâre gradientă stocastică folosind o singură probă
- Coborâre în gradient mini-lot folosind grupuri mici
- Metode de impuls și adaptive precum Adam
Suprafețele cu pierderi neconvexe fac parcursul dificil. Punctele de șea, minimele locale și platourile încetinesc progresul. În practică, metodele stocastice evită capcanele superficiale și găsesc soluții bune chiar și fără garanții de optimalitate globală.
Comments
No comments yet. Be the first to share a thought.
Leave a comment