EN - FR - DE - ES - IT - PT -

LexiconDream

🧪 Videndestillation

Træning af en lille model til at efterligne en større models opførsel.

Videndestillation

Store modeller lærer godt, men arbejder langsomt. Små modeller arbejder hurtigt, men lærer mindre. Videndestillation opdeler forskellen ved at træne en kompakt elevmodel til at imitere en større lærer ved hjælp af lærerens bløde forudsigelser i stedet for kun hårde betegnelser.

Bløde forudsigelser indeholder mere information. Når en lærer tildeler 70 procent sandsynlighed til kat og 25 procent til hund, lærer eleven, at kat og hund deler træk. Hårde betegnelser ville kun sige kat. Det ekstra signal hjælper eleven med at generalisere bedre end at træne udelukkende på betegnelser.

Almindelige destillationsvarianter

Teknikken driver mange produktionssystemer. Mobile assistenter, anbefalingsmodeller og realtidsdetektorer er ofte afhængige af destillerede elever, der bevarer det meste af lærerens nøjagtighed til en brøkdel af prisen.

Comments (2)

  1. Robert Ashford
    Knowledge distillation is how you compress a large model into a smaller one without losing too much performance. Useful for deployment.
  2. Nadia F.
    The article is clear. Training a small model to mimic the behavior of a larger model. Simple but important in AI.

Leave a comment