Si se apilan operaciones lineales, se obtiene una línea. Si se añade una función de activación entre capas, la red se curva. Esa curvatura es lo que permite que una red neuronal modele curvas, aristas y todo aquello que la aritmética directa no puede capturar.
Las unidades lineales rectificadas, o ReLU, predominan en la práctica moderna. Generan cero para entradas negativas y transmiten los valores positivos sin cambios. Son económicas de calcular y se entrenan rápidamente. Las funciones sigmoide y tanh surgieron primero, comprimiendo las salidas en rangos limitados, pero se saturan y ralentizan el aprendizaje en redes neuronales profundas.
Funciones de activación comunes
- ReLU, el valor predeterminado para la mayoría de las redes neuronales profundas.
- Leaky ReLU, que permite un gradiente pequeño para valores negativos.
- Sigmoide, utilizada para salidas binarias.
- Tanh, compresión centrada en cero
- Softmax, conversión de puntuaciones a probabilidades
Elegir mal sí importa. Una red de activaciones puramente lineales se reduce a una única transformación lineal, independientemente de la cantidad de capas que se apilen. La no linealidad no es un adorno; es la razón por la que la profundidad resulta útil.
Comments
No comments yet. Be the first to share a thought.
Leave a comment