Stapel lineaire bewerkingen op elkaar en je krijgt nog steeds een rechte lijn. Voeg een activeringsfunctie toe tussen de lagen en het netwerk buigt. Die buiging is wat een neuraal netwerk in staat stelt om krommingen, randen en al het andere te modelleren dat met pure rekenkunde niet mogelijk is.
Rectified linear units, ofwel ReLU's, domineren de moderne programmeerpraktijk. Ze geven nul als uitvoer voor negatieve invoer en laten positieve waarden ongewijzigd door. Ze zijn goedkoop te berekenen en trainen snel. Sigmoid- en tanh-functies waren er eerder, die de uitvoer beperken tot een bepaald bereik, maar ze raken verzadigd en vertragen het leerproces in diepe neurale netwerken.
Algemene activeringsfuncties
- ReLU, de standaard voor de meeste deep learning-netwerken.
- Leaky ReLU, waardoor een kleine gradiënt voor negatieve waarden mogelijk is.
- Sigmoid, gebruikt voor binaire uitvoer
- Tanh, nulgecentreerde squashing
- Softmax, het omzetten van scores naar waarschijnlijkheden
De verkeerde keuze maakt wel degelijk verschil. Een netwerk van uitsluitend lineaire activaties stort in tot één enkele lineaire transformatie, ongeacht hoeveel lagen je stapelt. Niet-lineariteit is geen decoratie. Het is juist de reden waarom diepte überhaupt nuttig is.
Comments
No comments yet. Be the first to share a thought.
Leave a comment