EN - FR - DE - ES - IT - PT -

LexiconDream

🧪 Kunnskapsdestillasjon

Trener en liten modell for å etterligne oppførselen til en større modell.

Kunnskapsdestillasjon

Store modeller lærer bra, men jobber sakte. Små modeller jobber fort, men lærer mindre. Kunnskapsdestillasjon deler forskjellen ved å trene en kompakt elevmodell til å imitere en større lærer, ved å bruke lærerens myke prediksjoner i stedet for bare harde etiketter.

Myke prediksjoner inneholder mer informasjon. Når en lærer tildeler 70 prosent sannsynlighet til katt og 25 prosent til hund, lærer eleven at katt og hund deler trekk. Harde etiketter ville bare si katt. Det ekstra signalet hjelper eleven med å generalisere bedre enn å trene på etiketter alene.

Vanlige destillasjonsvarianter

Teknikken driver mange produksjonssystemer. Mobile assistenter, anbefalingsmodeller og sanntidsdetektorer er ofte avhengige av destillerte elever som beholder mesteparten av lærerens nøyaktighet til en brøkdel av kostnaden.

Comments (2)

  1. Robert Ashford
    Knowledge distillation is how you compress a large model into a smaller one without losing too much performance. Useful for deployment.
  2. Nadia F.
    The article is clear. Training a small model to mimic the behavior of a larger model. Simple but important in AI.

Leave a comment