Imagina que bajas por una colina neblinosa, sientes la pendiente bajo tus pies y das pasos en la dirección descendente. El descenso de gradiente hace lo mismo con una función de pérdida. Calcula la pendiente, da un paso y repite el proceso hasta que la pérdida deja de mejorar.
La tasa de aprendizaje controla el tamaño del paso. Si es demasiado grande, se sobrepasa el mínimo. Si es demasiado pequeña, el entrenamiento se prolonga indefinidamente. Momentum, Adam y otros optimizadores adaptan la tasa durante el entrenamiento para acelerar la convergencia.
Variantes comunes
- Descenso de gradiente por lotes utilizando todos los datos
- Descenso de gradiente estocástico utilizando una muestra
- Descenso de gradiente por mini-lotes utilizando grupos pequeños
- Momentum y métodos adaptativos como Adam
Las superficies de pérdida no convexas dificultan el proceso. Los puntos de silla, los mínimos locales y las mesetas ralentizan el progreso. En la práctica, los métodos estocásticos evitan las trampas superficiales y encuentran buenas soluciones incluso sin garantías de optimalidad global.
Comments
No comments yet. Be the first to share a thought.
Leave a comment