EN - FR - DE - ES - IT - PT -

LexiconDream

🧪 Kunskapsdestillation

Träna en liten modell att efterlikna en större modells beteende.

Kunskapsdestillation

Stora modeller lär sig bra men fungerar långsamt. Små modeller fungerar snabbt men lär sig mindre. Kunskapsdestillation delar upp skillnaden genom att träna en kompakt elevmodell att imitera en större lärare, med hjälp av lärarens mjuka förutsägelser snarare än bara hårda etiketter.

Mjuka förutsägelser innehåller mer information. När en lärare tilldelar 70 procents sannolikhet till katt och 25 procent till hund, lär sig eleven att katt och hund delar egenskaper. Hårda etiketter skulle bara säga katt. Den extra signalen hjälper eleven att generalisera bättre än att träna enbart på etiketter.

Vanliga destillationsvarianter

Tekniken driver många produktionssystem. Mobila assistenter, rekommendationsmodeller och realtidsdetektorer förlitar sig ofta på destillerade elever som behåller det mesta av lärarens noggrannhet till en bråkdel av kostnaden.

Comments (2)

  1. Robert Ashford
    Knowledge distillation is how you compress a large model into a smaller one without losing too much performance. Useful for deployment.
  2. Nadia F.
    The article is clear. Training a small model to mimic the behavior of a larger model. Simple but important in AI.

Leave a comment