Stable lineære operationer, og du får stadig en linje. Tilføj en aktiveringsfunktion mellem lagene, og netværket bøjer. Det er denne bøjning, der lader et neuralt netværk modellere kurver, kanter og alt andet, som lige aritmetik ikke kan indfange.
Rektificerede lineære enheder, eller ReLU'er, dominerer moderne praksis. De udsender nul for negative input og sender positive værdier uændret. De er billige at beregne, og de træner hurtigt. Sigmoid og tanh kom først, hvilket pressede output ind i begrænsede områder, men de mætter og bremser læring i dybe netværk.
Almindelige aktiveringsfunktioner
- ReLU, standarden for de fleste dybe netværk
- Utæt ReLU, der tillader en lille gradient for negativer
- Sigmoid, bruges til binære udgange
- Tanh, nul-centreret klemning
- Softmax, konvertering af scorer til sandsynligheder
Det er vigtigt at vælge forkert. Et netværk af kun lineære aktiveringer kollapser til en enkelt lineær transformation, uanset hvor mange lag du stabler. Ikke-linearitet er ikke dekoration. Det er grunden til, at dybde overhovedet hjælper.
Comments
No comments yet. Be the first to share a thought.
Leave a comment