Stosując operacje liniowe, nadal otrzymasz linię. Dodaj funkcję aktywacji między warstwami, a sieć się zakrzywi. To zakrzywienie pozwala sieci neuronowej modelować krzywe, krawędzie i wszystko inne, czego nie jest w stanie uchwycić prosta arytmetyka.
Rektyfikowane jednostki liniowe, czyli ReLU, dominują we współczesnej praktyce. Wyprowadzają zero dla ujemnych danych wejściowych i przekazują wartości dodatnie bez zmian. Są tanie w obliczeniach i szybko się uczą. Najpierw pojawiły się sigmoidalne i tanh, które spłaszczały dane wyjściowe do ograniczonych zakresów, ale powodują nasycenie i spowalniają uczenie się w sieciach głębokich.
Typowe funkcje aktywacji
- ReLU, domyślne rozwiązanie dla większości głębokich sieci
- Nieszczelny ReLU, umożliwiający niewielki gradient dla negatywów
- Sigmoidalny, używany do wyjść binarnych
- Tanh, zgniatanie z zerowym środkiem
- Softmax, konwersja wyników na prawdopodobieństwa
Błędny wybór ma znaczenie. Sieć wyłącznie liniowych aktywacji załamuje się w pojedynczą transformację liniową, niezależnie od liczby warstw. Nieliniowość nie jest ozdobą. To właśnie dlatego głębia w ogóle pomaga.
Comments
No comments yet. Be the first to share a thought.
Leave a comment