大規模モデルは学習能力が高いものの、動作が遅い。小規模モデルは動作が速いものの、学習能力は低い。知識蒸留は、教師モデルの厳密なラベルだけでなく、ソフトな予測も利用して、より大規模な教師モデルを模倣するようにコンパクトな生徒モデルを訓練することで、この両者の中間的なアプローチを実現する。
曖昧な予測はより多くの情報を含んでいます。教師が猫に70%、犬に25%の確率を割り当てると、生徒は猫と犬が共通の特徴を持っていることを学びます。一方、明確なラベルでは猫としか示されません。このような追加のシグナルは、ラベルのみによる訓練よりも生徒の一般化能力を高めるのに役立ちます。
一般的な蒸留方法
- 出力ロジットからの応答ベースの蒸留
- 中間層からの特徴ベースの蒸留
- レイヤー間の関係に基づく関係ベースの蒸留
- 同一アーキテクチャ内での自己蒸留
この技術は、多くの生産システムを支えている。モバイルアシスタント、レコメンデーションモデル、リアルタイム検出器などは、教師モデルの精度をほぼ維持しつつ、コストを大幅に削減した「蒸留された生徒」モデルに依存することが多い。
Comments (2)
Leave a comment