Tenk deg at du går ned en tåkete bakke, kjenner skråningen under føttene og går i retningen som går ned. Gradientnedstigning gjør det samme med en tapsfunksjon. Den beregner skråningen, tar et skritt og gjentar til tapet slutter å bli bedre.
Læringshastigheten styrer trinnstørrelsen. For stor, og du overskrider minimumsgrensen. For liten, og treningen tar evigheter. Momentum, Adam og andre optimaliseringsprogrammer tilpasser hastigheten under trening for å øke hastigheten på konvergensen.
Vanlige varianter
- Batch-gradientnedstigning ved bruk av alle data
- Stokastisk gradientnedstigning ved bruk av én prøve
- Mini-batch gradient nedstigning ved bruk av små grupper
- Momentum og adaptive metoder som Adam
Ikke-konvekse tapsflater gjør reisen vanskelig. Sadelpunkter, lokale minima og platåer bremser alle fremdriften. I praksis unnslipper stokastiske metoder grunne feller og finner gode løsninger selv uten garantier for global optimalitet.
Comments
No comments yet. Be the first to share a thought.
Leave a comment