Empilez des opérations linéaires et vous obtiendrez toujours une ligne. Ajoutez une fonction d'activation entre les couches et le réseau se courbe. C'est cette courbure qui permet à un réseau neuronal de modéliser les courbes, les contours et tout ce que l'arithmétique pure ne peut pas saisir.
Les fonctions d'activation ReLU (Rectified Linear Unit) sont largement utilisées aujourd'hui. Elles produisent une valeur nulle pour les entrées négatives et laissent passer les valeurs positives sans modification. Peu coûteuses à calculer, elles permettent un apprentissage rapide. Les fonctions sigmoïde et tangente hyperbolique, apparues en premier, compriment les sorties dans des intervalles bornés, mais elles saturent et ralentissent l'apprentissage dans les réseaux profonds.
fonctions d'activation communes
- ReLU, la fonction par défaut pour la plupart des réseaux profonds
- ReLU fuyant, autorisant un faible gradient pour les valeurs négatives
- Sigmoïde, utilisée pour les sorties binaires
- Tanh, écrasement centré sur zéro
- Softmax, conversion des scores en probabilités
Faire le mauvais choix a des conséquences. Un réseau composé uniquement d'activations linéaires se réduit à une simple transformation linéaire, quel que soit le nombre de couches superposées. La non-linéarité n'est pas un simple ornement : c'est ce qui rend la profondeur si utile.
Comments
No comments yet. Be the first to share a thought.
Leave a comment