Stabl lineære operasjoner, og du får fortsatt en linje. Legg til en aktiveringsfunksjon mellom lagene, og nettverket bøyer seg. Denne bøyningen er det som lar et nevralt nettverk modellere kurver, kanter og alt annet som rett aritmetikk ikke kan fange opp.
Rettede lineære enheter, eller ReLU-er, dominerer moderne praksis. De gir ut null for negative innganger og sender positive verdier uendret. De er billige å beregne, og de trener raskt. Sigmoid og tanh kom først, og presset utgangene inn i begrensede områder, men de metter og bremser læring i dype nettverk.
Vanlige aktiveringsfunksjoner
- ReLU, standarden for de fleste dype nettverk
- Lekk ReLU, som tillater en liten gradient for negativer
- Sigmoid, brukt til binære utganger
- Tanh, null-sentrert kleming
- Softmax, konverterer poengsummer til sannsynligheter
Det er viktig å velge feil. Et nettverk av kun lineære aktiveringer kollapser til én lineær transformasjon, uansett hvor mange lag du stabler. Ikke-linearitet er ikke dekorasjon. Det er grunnen til at dybde i det hele tatt hjelper.
Comments
No comments yet. Be the first to share a thought.
Leave a comment