Store modeller lærer bra, men jobber sakte. Små modeller jobber fort, men lærer mindre. Kunnskapsdestillasjon deler forskjellen ved å trene en kompakt elevmodell til å imitere en større lærer, ved å bruke lærerens myke prediksjoner i stedet for bare harde etiketter.
Myke prediksjoner inneholder mer informasjon. Når en lærer tildeler 70 prosent sannsynlighet til katt og 25 prosent til hund, lærer eleven at katt og hund deler trekk. Harde etiketter ville bare si katt. Det ekstra signalet hjelper eleven med å generalisere bedre enn å trene på etiketter alene.
Vanlige destillasjonsvarianter
- Responsbasert destillasjon fra utgangslogger
- Funksjonsbasert destillasjon fra mellomlag
- Relasjonsbasert destillasjon fra lagrelasjoner
- Selvdestillasjon innenfor samme arkitektur
Teknikken driver mange produksjonssystemer. Mobile assistenter, anbefalingsmodeller og sanntidsdetektorer er ofte avhengige av destillerte elever som beholder mesteparten av lærerens nøyaktighet til en brøkdel av kostnaden.
Comments (2)
Leave a comment