Store modeller lærer godt, men arbejder langsomt. Små modeller arbejder hurtigt, men lærer mindre. Videndestillation opdeler forskellen ved at træne en kompakt elevmodel til at imitere en større lærer ved hjælp af lærerens bløde forudsigelser i stedet for kun hårde betegnelser.
Bløde forudsigelser indeholder mere information. Når en lærer tildeler 70 procent sandsynlighed til kat og 25 procent til hund, lærer eleven, at kat og hund deler træk. Hårde betegnelser ville kun sige kat. Det ekstra signal hjælper eleven med at generalisere bedre end at træne udelukkende på betegnelser.
Almindelige destillationsvarianter
- Responsbaseret destillation fra outputlogitter
- Funktionsbaseret destillation fra mellemliggende lag
- Relationsbaseret destillation fra lagrelationer
- Selvdestillation inden for den samme arkitektur
Teknikken driver mange produktionssystemer. Mobile assistenter, anbefalingsmodeller og realtidsdetektorer er ofte afhængige af destillerede elever, der bevarer det meste af lærerens nøjagtighed til en brøkdel af prisen.
Comments (2)
Leave a comment