EN - FR - DE - ES - IT - PT -

LexiconDream

🧪 Distilarea cunoștințelor

Antrenarea unui model mic pentru a imita comportamentul unui model mai mare.

Distilarea cunoștințelor

Modelele mari învață bine, dar rulează lent. Modelele mici rulează rapid, dar învață mai puțin. Distilarea cunoștințelor elimină diferența prin antrenarea unui model compact de student să imite un profesor mai mare, folosind predicții ușoare ale profesorului, mai degrabă decât doar etichete rigide.

Predicțiile „soft” conțin mai multe informații. Când un profesor atribuie o probabilitate de 70% pisicii și 25% câinelui, elevul învață că pisica și câinele au caracteristici comune. Etichetele „hard” ar spune doar pisica. Acest semnal suplimentar îl ajută pe elev să generalizeze mai bine decât antrenarea doar pe baza etichetelor.

Variante comune de distilare

Tehnica este utilizată în multe sisteme de producție. Asistenții mobili, modelele de recomandare și detectoarele în timp real se bazează adesea pe informații distilate pentru studenți, care păstrează cea mai mare parte a preciziei profesorului la o fracțiune din cost.

Comments (2)

  1. Robert Ashford
    Knowledge distillation is how you compress a large model into a smaller one without losing too much performance. Useful for deployment.
  2. Nadia F.
    The article is clear. Training a small model to mimic the behavior of a larger model. Simple but important in AI.

Leave a comment