Forestil dig at gå ned ad en tåget bakke, mærke hældningen under dine fødder og træde i den retning, der går nedad. Gradientnedstigning gør det samme med en tabsfunktion. Den beregner hældningen, tager et skridt og gentager, indtil tabet holder op med at blive bedre.
Læringshastigheden styrer trinstørrelsen. For stor, og du overskrider minimumsgrænsen. For lille, og træningen tager evigheder. Momentum, Adam og andre optimeringsværktøjer tilpasser hastigheden under træning for at fremskynde konvergensen.
Almindelige varianter
- Batchgradientnedgang ved hjælp af alle data
- Stokastisk gradientnedstigning ved hjælp af én prøve
- Mini-batch gradientnedstigning ved hjælp af små grupper
- Momentum og adaptive metoder som Adam
Ikke-konvekse tabsflader gør rejsen vanskelig. Sadelpunkter, lokale minima og plateauer forsinker alle fremskridtet. I praksis undgår stokastiske metoder overfladiske fælder og finder gode løsninger, selv uden garantier for global optimalitet.
Comments
No comments yet. Be the first to share a thought.
Leave a comment