선형 연산을 여러 개 쌓아도 여전히 직선이 됩니다. 하지만 레이어 사이에 활성화 함수를 추가하면 신경망이 휘어집니다. 바로 이 휘어짐 덕분에 신경망은 직선 연산으로는 포착할 수 없는 곡선, 모서리, 그 외 모든 것을 모델링할 수 있는 것입니다.
현대 프로그래밍에서는 ReLU(정류 선형 단위)가 지배적입니다. ReLU는 음수 입력에 대해 0을 출력하고 양수 값은 변경하지 않고 그대로 전달합니다. 계산 비용이 저렴하고 학습 속도가 빠릅니다. 시그모이드와 tanh 함수가 먼저 등장하여 출력을 제한된 범위 내로 압축했지만, 심층 신경망에서는 포화되어 학습 속도를 저하시킵니다.
공통 활성화 기능
- ReLU는 대부분의 딥러닝 네트워크에서 기본값으로 사용됩니다.
- Leaky ReLU는 음수에 대해 작은 기울기를 허용합니다.
- 시그모이드 함수는 이진 출력에 사용됩니다.
- Tanh, 0 중심 스쿼싱
- 소프트맥스, 점수를 확률로 변환
잘못된 선택은 중요합니다. 선형 활성화만으로 이루어진 네트워크는 아무리 많은 레이어를 쌓아도 결국 하나의 선형 변환으로 귀결됩니다. 비선형성은 장식이 아닙니다. 깊이감이 중요한 이유가 바로 비선형성 때문입니다.
Comments
No comments yet. Be the first to share a thought.
Leave a comment