Große Modelle lernen gut, sind aber langsam. Kleine Modelle sind schnell, lernen aber weniger. Wissensdestillation schließt diese Lücke, indem sie ein kompaktes Schülermodell trainiert, das ein größeres Lehrermodell imitiert und dabei dessen weiche Vorhersagen anstelle von harten Labels verwendet.
Weiche Vorhersagen enthalten mehr Informationen. Wenn eine Lehrkraft der Katze eine Wahrscheinlichkeit von 70 Prozent und dem Hund eine von 25 Prozent zuweist, lernt der Schüler, dass Katze und Hund gemeinsame Merkmale haben. Harte Zuordnungen würden nur die Katze als Kategorie festlegen. Dieses zusätzliche Signal hilft dem Schüler, besser zu generalisieren als durch das Training mit reinen Zuordnungen.
Gängige Destillationsvarianten
- Antwortbasierte Destillation aus Ausgabelogits
- Merkmalsbasierte Destillation aus Zwischenschichten
- relationenbasierte Destillation aus Schichtbeziehungen
- Selbstdestillation innerhalb derselben Architektur
Diese Technik bildet die Grundlage vieler Produktionssysteme. Mobile Assistenten, Empfehlungsmodelle und Echtzeit-Detektoren greifen häufig auf destillierte Lernergebnisse zurück, die den Großteil der Genauigkeit des ursprünglichen Lernsystems zu einem Bruchteil der Kosten beibehalten.
Comments (2)
Leave a comment