浮點數雖然精確,但計算量很大。量化會降低模型權重和活化值的數值精確度,通常從 32 位元浮點數降至 8 位元或 4 位元整數。這樣一來,模型體積更小、運行速度更快、功耗更低。
權衡之處在於精度。激進的量化會降低輸出質量,尤其是在需要精細數值區分的任務中。訓練後量化成本低但有損。量化感知訓練會在訓練過程中模擬低精度,從而恢復大部分損失的精確度。
常用量化級別
- 16 位元浮點運算,輕微壓縮
- 8 位整數,廣泛用於推理
- 4 位整數,雖然激進,但謹慎使用是可行的。
- 二元和三元,實驗性的
硬體支援情況各不相同。有些加速器原生支援 8 位元運算,可顯著提升速度。而有些加速器則會回退到速度較慢的運算路徑。量化方案的選擇不僅取決於模型本身,還取決於部署目標。
Comments
No comments yet. Be the first to share a thought.
Leave a comment