EN - FR - DE - ES - IT - PT -

LexiconDream

🧪 Kennisdistillatie

Een klein model trainen om het gedrag van een groter model na te bootsen.

Kennisdistillatie

Grote modellen leren goed, maar werken traag. Kleine modellen werken snel, maar leren minder. Kennisdestillatie overbrugt dit verschil door een compact leerlingmodel te trainen om een ​​groter leraarmodel na te bootsen, waarbij gebruik wordt gemaakt van de zachte voorspellingen van de leraar in plaats van alleen harde labels.

Zachte voorspellingen bevatten meer informatie. Wanneer een leraar 70 procent kans toekent aan een kat en 25 procent aan een hond, leert de leerling dat kat en hond gemeenschappelijke kenmerken hebben. Harde labels zouden alleen 'kat' zeggen. Dat extra signaal helpt de leerling beter te generaliseren dan wanneer er alleen op labels wordt getraind.

Veelvoorkomende distillatievarianten

Deze techniek vormt de basis van veel productiesystemen. Mobiele assistenten, aanbevelingsmodellen en realtime detectoren maken vaak gebruik van vereenvoudigde modellen van leerlingen die de nauwkeurigheid van de leraar grotendeels behouden, maar tegen een fractie van de kosten.

Comments (2)

  1. Robert Ashford
    Knowledge distillation is how you compress a large model into a smaller one without losing too much performance. Useful for deployment.
  2. Nadia F.
    The article is clear. Training a small model to mimic the behavior of a larger model. Simple but important in AI.

Leave a comment