Grote modellen leren goed, maar werken traag. Kleine modellen werken snel, maar leren minder. Kennisdestillatie overbrugt dit verschil door een compact leerlingmodel te trainen om een groter leraarmodel na te bootsen, waarbij gebruik wordt gemaakt van de zachte voorspellingen van de leraar in plaats van alleen harde labels.
Zachte voorspellingen bevatten meer informatie. Wanneer een leraar 70 procent kans toekent aan een kat en 25 procent aan een hond, leert de leerling dat kat en hond gemeenschappelijke kenmerken hebben. Harde labels zouden alleen 'kat' zeggen. Dat extra signaal helpt de leerling beter te generaliseren dan wanneer er alleen op labels wordt getraind.
Veelvoorkomende distillatievarianten
- Op respons gebaseerde distillatie van uitvoerlogits
- Op kenmerken gebaseerde distillatie uit tussenlagen
- Relatiegebaseerde distillatie uit laagrelaties
- Zelfdestillatie binnen dezelfde architectuur
Deze techniek vormt de basis van veel productiesystemen. Mobiele assistenten, aanbevelingsmodellen en realtime detectoren maken vaak gebruik van vereenvoudigde modellen van leerlingen die de nauwkeurigheid van de leraar grotendeels behouden, maar tegen een fractie van de kosten.
Comments (2)
Leave a comment