Wyobraź sobie, że schodzisz z mglistego wzgórza, czujesz nachylenie pod stopami i stawiasz krok w kierunku, w którym ono opada. Metoda gradientu spadkowego działa tak samo z funkcją straty. Oblicza nachylenie, robi krok i powtarza tę czynność, aż strata przestanie się zmniejszać.
Tempo uczenia się kontroluje wielkość kroku. Zbyt duże powoduje przekroczenie minimum. Zbyt małe powoduje, że trening trwa wiecznie. Momentum, Adam i inne optymalizatory dostosowują tempo podczas treningu, aby przyspieszyć konwergencję.
Typowe warianty
- Wsadowe zbocze gradientowe z wykorzystaniem wszystkich danych
- Stochastyczny spadek gradientu z wykorzystaniem jednej próbki
- Mini-partia zejście gradientowe z wykorzystaniem małych grup
- Pęd i metody adaptacyjne, takie jak Adam
Niewypukłe powierzchnie strat utrudniają podróż. Punkty siodłowe, minima lokalne i plateau spowalniają postęp. W praktyce metody stochastyczne unikają płytkich pułapek i znajdują dobre rozwiązania nawet bez gwarancji globalnej optymalności.
Comments
No comments yet. Be the first to share a thought.
Leave a comment