線形演算を積み重ねても、得られるのはやはり直線です。しかし、層間に活性化関数を追加すると、ネットワークは曲がります。この曲がりこそが、ニューラルネットワークが曲線やエッジなど、単純な算術演算では捉えられないあらゆるものをモデル化できる理由なのです。
現代の手法では、整流線形ユニット(ReLU)が主流となっている。ReLUは負の入力に対してはゼロを出力し、正の値はそのまま出力する。計算コストが低く、学習も高速である。シグモイド関数やtanh関数は、出力を限定された範囲に圧縮する目的で最初に登場したが、ディープネットワークでは飽和を起こし、学習速度を低下させる。
一般的な活性化関数
- ほとんどのディープネットワークのデフォルトであるReLU
- リーキーReLU、負の値に対して小さな勾配を許容する
- シグモイド関数は、バイナリ出力に使用されます。
- Tanh、ゼロ中心圧縮
- ソフトマックス法、スコアを確率に変換する
間違った選択は重大な問題です。線形活性化関数のみで構成されたネットワークは、どれだけ多くの層を重ねても、単一の線形変換に収束してしまいます。非線形性は単なる装飾ではありません。むしろ、深層化が有効な理由そのものです。
Comments
No comments yet. Be the first to share a thought.
Leave a comment