Se aprenden los pesos. Se eligen los hiperparámetros. La tasa de aprendizaje, el tamaño del lote, el número de capas, la tasa de abandono (dropout) y la intensidad de la regularización entran en esta categoría. Controlan cómo se desarrolla el entrenamiento y cómo se estructura el modelo.
Cometer errores supone una pérdida de tiempo y capacidad de procesamiento. Una tasa de aprendizaje demasiado alta provoca divergencias; una demasiado baja, ralentizaciones. El tamaño del lote afecta al ruido del gradiente y al uso de la memoria. La profundidad y la amplitud determinan la capacidad, que debe ajustarse a la complejidad de la tarea y al tamaño de los datos.
Métodos de ajuste comunes
- Búsqueda en cuadrícula sobre un conjunto fijo
- Búsqueda aleatoria para una cobertura más amplia
- Optimización bayesiana para la eficiencia
- Formación basada en la población
- Afinación manual guiada por la intuición.
La optimización es costosa. Cada configuración requiere una prueba de entrenamiento completa, y el espacio de búsqueda crece rápidamente. Los profesionales experimentados reducen el espacio con conocimiento del dominio antes de automatizar, lo que suele ser más efectivo que la búsqueda por fuerza bruta.
Comments (2)
Leave a comment