EN - FR - DE - ES - IT - PT -

LexiconDream

🧪 知識蒸留

より大きなモデルの動作を模倣するように小さなモデルをトレーニングします。

知識蒸留

大規模モデルは学習能力が高いものの、動作が遅い。小規模モデルは動作が速いものの、学習能力は低い。知識蒸留は、教師モデルの厳密なラベルだけでなく、ソフトな予測も利用して、より大規模な教師モデルを模倣するようにコンパクトな生徒モデルを訓練することで、この両者の中間的なアプローチを実現する。

曖昧な予測はより多くの情報を含んでいます。教師が猫に70%、犬に25%の確率を割り当てると、生徒は猫と犬が共通の特徴を持っていることを学びます。一方、明確なラベルでは猫としか示されません。このような追加のシグナルは、ラベルのみによる訓練よりも生徒の一般化能力を高めるのに役立ちます。

一般的な蒸留方法

この技術は、多くの生産システムを支えている。モバイルアシスタント、レコメンデーションモデル、リアルタイム検出器などは、教師モデルの精度をほぼ維持しつつ、コストを大幅に削減した「蒸留された生徒」モデルに依存することが多い。

Comments (2)

  1. Robert Ashford
    Knowledge distillation is how you compress a large model into a smaller one without losing too much performance. Useful for deployment.
  2. Nadia F.
    The article is clear. Training a small model to mimic the behavior of a larger model. Simple but important in AI.

Leave a comment