大型模型在基準測試中勝出,而小型模型則可以投入實際應用。模型壓縮能夠在減少模型體積和計算量的同時,最大程度地保留原始精度,從而使其能夠部署在手機、嵌入式設備和對成本要求較高的伺服器上。
多種技術相結合。剪枝會移除貢獻較小的權重。量化會降低數值精度。蒸餾會訓練出一個規模較小的學習器。低秩分解會分解權重矩陣。在實務中,工程師會將這些方法疊加使用。
常用壓縮方法
- 修剪不重要的權重或神經元
- 量化至 8 位或更低
- 將知識提煉成較小的學生群體
- 低秩矩陣分解
- 建築界尋求高效設計
壓縮是有限制的。精度會下降,而且激進的壓縮方法可能會導致一些只有在極少數情況下才會出現的異常行為。因此,在壓縮前後使用代表性的數據進行基準測試至關重要。
Comments
No comments yet. Be the first to share a thought.
Leave a comment