Skládejte lineární operace a stále získáte čáru. Přidejte aktivační funkci mezi vrstvy a ohyby sítě. Tento ohyb umožňuje neuronové síti modelovat křivky, hrany a vše ostatní, co přímá aritmetika nedokáže zachytit.
V moderní praxi dominují usměrněné lineární jednotky, neboli ReLU. Jejich výstupem je nula pro záporné vstupy a kladné hodnoty předávají beze změny. Jejich výpočetní výkon je levný a jejich učení je rychlé. Sigmoidní a tanhové jednotky byly první a stlačovaly výstupy do omezených rozsahů, ale v hlubokých sítích docházelo k jejich saturaci a zpomalování učení.
Běžné aktivační funkce
- ReLU, výchozí nastavení pro většinu hlubokých sítí
- Leaky ReLU, umožňující malý gradient pro negativy
- Sigmoid, používaný pro binární výstupy
- Tanh, nulocentrované stlačování
- Softmax, převod skóre na pravděpodobnosti
Špatná volba je důležitá. Síť pouze lineárních aktivací se zhroutí do jediné lineární transformace, bez ohledu na to, kolik vrstev na sebe naskládáte. Nelinearita není dekorace. Je to důvod, proč hloubka vůbec pomáhá.
Comments
No comments yet. Be the first to share a thought.
Leave a comment