대규모 모델은 벤치마크에서 우수한 성능을 발휘하지만, 소규모 모델은 출시가 용이합니다. 모델 압축은 크기와 연산량을 줄이면서도 원래 정확도를 대부분 유지하여 스마트폰, 임베디드 기기, 비용에 민감한 서버 등 다양한 환경에 배포할 수 있도록 합니다.
여러 기법이 결합됩니다. 가지치기는 기여도가 낮은 가중치를 제거합니다. 양자화는 수치 정밀도를 낮춥니다. 증류는 더 작은 학습 모델을 만듭니다. 저차 인수분해는 가중치 행렬을 분해합니다. 실제로 엔지니어들은 이러한 방법들을 순차적으로 적용합니다.
일반적인 압축 방법
- 중요하지 않은 가중치 또는 뉴런을 가지치기합니다.
- 8비트 이하로 양자화
- 지식을 간추려 소규모 학생들에게 전달하기
- 저차 행렬 분해
- 효율적인 디자인을 위한 건축 탐색
압축에는 한계가 있습니다. 정확도가 떨어지고, 과도한 압축 방식은 드문 입력값에서만 나타나는 예상치 못한 동작 오류를 발생시킬 수 있습니다. 따라서 압축 전후의 대표적인 데이터를 사용하여 벤치마킹하는 것이 필수적입니다.
Comments
No comments yet. Be the first to share a thought.
Leave a comment