Stapla linjära operationer och du får fortfarande en linje. Lägg till en aktiveringsfunktion mellan lagren så böjer sig nätverket. Den böjningen är det som låter ett neuralt nätverk modellera kurvor, kanter och allt annat som rak aritmetik inte kan fånga.
Likriktade linjära enheter, eller ReLU, dominerar modern praxis. De matar ut noll för negativa ingångar och skickar positiva värden oförändrade. De är billiga att beräkna och de tränas snabbt. Sigmoid och tanh kom först och pressade utsignaler till begränsade områden, men de mättar och saktar ner inlärningen i djupa nätverk.
Vanliga aktiveringsfunktioner
- ReLU, standardinställningen för de flesta djupa nätverk
- Läckande ReLU, vilket möjliggör en liten gradient för negativa bilder
- Sigmoid, används för binära utgångar
- Tanh, nollcentrerad krossning
- Softmax, omvandling av poäng till sannolikheter
Att välja fel spelar roll. Ett nätverk av endast linjära aktiveringar kollapsar till en enda linjär transformation, oavsett hur många lager man staplar. Icke-linjäritet är inte dekoration. Det är anledningen till att djup alls hjälper.
Comments
No comments yet. Be the first to share a thought.
Leave a comment