부동 소수점 숫자는 정확하지만 용량이 큽니다. 양자화는 모델 가중치와 활성화 값의 수치 정밀도를 낮추는데, 일반적으로 32비트 부동 소수점에서 8비트 또는 4비트 정수로 줄입니다. 이렇게 하면 모델의 크기가 작아지고 실행 속도가 빨라지며 전력 소모도 줄어듭니다.
절충점은 정확도입니다. 공격적인 양자화는 출력 품질을 저하시키는데, 특히 미세한 수치적 구분이 필요한 작업에서 더욱 그렇습니다. 학습 후 양자화는 비용은 저렴하지만 손실이 발생합니다. 양자화 인식 학습은 학습 중에 낮은 정밀도를 시뮬레이션하여 손실된 정확도를 상당 부분 복구합니다.
일반적인 양자화 레벨
- 16비트 부동 소수점, 약간의 압축
- 8비트 정수, 추론에 널리 사용됨
- 4비트 정수, 공격적이지만 주의해서 사용하면 실현 가능합니다.
- 이진법 및 삼진법, 실험적
하드웨어 지원은 다양합니다. 일부 가속기는 8비트를 기본적으로 처리하여 상당한 속도 향상을 제공하는 반면, 다른 가속기는 더 느린 경로를 사용합니다. 양자화 방식을 선택하는 것은 모델뿐만 아니라 배포 대상에 따라서도 달라집니다.
Comments
No comments yet. Be the first to share a thought.
Leave a comment