EN - FR - DE - ES - IT - PT -

LexiconDream

🧪 Wissensdestillation

Ein kleines Modell wird trainiert, das Verhalten eines größeren nachzuahmen.

Wissensdestillation

Große Modelle lernen gut, sind aber langsam. Kleine Modelle sind schnell, lernen aber weniger. Wissensdestillation schließt diese Lücke, indem sie ein kompaktes Schülermodell trainiert, das ein größeres Lehrermodell imitiert und dabei dessen weiche Vorhersagen anstelle von harten Labels verwendet.

Weiche Vorhersagen enthalten mehr Informationen. Wenn eine Lehrkraft der Katze eine Wahrscheinlichkeit von 70 Prozent und dem Hund eine von 25 Prozent zuweist, lernt der Schüler, dass Katze und Hund gemeinsame Merkmale haben. Harte Zuordnungen würden nur die Katze als Kategorie festlegen. Dieses zusätzliche Signal hilft dem Schüler, besser zu generalisieren als durch das Training mit reinen Zuordnungen.

Gängige Destillationsvarianten

Diese Technik bildet die Grundlage vieler Produktionssysteme. Mobile Assistenten, Empfehlungsmodelle und Echtzeit-Detektoren greifen häufig auf destillierte Lernergebnisse zurück, die den Großteil der Genauigkeit des ursprünglichen Lernsystems zu einem Bruchteil der Kosten beibehalten.

Comments (2)

  1. Robert Ashford
    Knowledge distillation is how you compress a large model into a smaller one without losing too much performance. Useful for deployment.
  2. Nadia F.
    The article is clear. Training a small model to mimic the behavior of a larger model. Simple but important in AI.

Leave a comment