Empilhe operações lineares e ainda obterá uma linha. Adicione uma função de ativação entre camadas e a rede curva-se. Esta curvatura é o que permite a uma rede neural modelar curvas, arestas e tudo o resto que a aritmética direta não consegue captar.
As unidades lineares retificadas, ou ReLUs, dominam a prática moderna. Produzem zero para entradas negativas e passam valores positivos sem alteração. São baratas de computar e treinam rapidamente. As funções sigmoide e tanh surgiram primeiro, comprimindo as saídas em intervalos limitados, mas saturam e tornam a aprendizagem lenta em redes profundas.
Funções de ativação comuns
- ReLU, a função padrão para a maioria das redes profundas.
- ReLU com fuga, permitindo um pequeno gradiente para valores negativos.
- Sigmoide, utilizada para saídas binárias.
- Tanh, esmagamento centrado em zero
- Softmax, convertendo pontuações em probabilidades
Escolher mal importa. Uma rede composta apenas por ativações lineares colapsa numa única transformação linear, independentemente do número de camadas que empilhe. A não linearidade não é mera decoração. É a razão pela qual a profundidade é útil.
Comments
No comments yet. Be the first to share a thought.
Leave a comment