Modelele mari învață bine, dar rulează lent. Modelele mici rulează rapid, dar învață mai puțin. Distilarea cunoștințelor elimină diferența prin antrenarea unui model compact de student să imite un profesor mai mare, folosind predicții ușoare ale profesorului, mai degrabă decât doar etichete rigide.
Predicțiile „soft” conțin mai multe informații. Când un profesor atribuie o probabilitate de 70% pisicii și 25% câinelui, elevul învață că pisica și câinele au caracteristici comune. Etichetele „hard” ar spune doar pisica. Acest semnal suplimentar îl ajută pe elev să generalizeze mai bine decât antrenarea doar pe baza etichetelor.
Variante comune de distilare
- Distilare bazată pe răspuns din logiturile de ieșire
- Distilare bazată pe caracteristici din straturi intermediare
- Distilare bazată pe relații din relațiile stratificate
- Autodistilare în cadrul aceleiași arhitecturi
Tehnica este utilizată în multe sisteme de producție. Asistenții mobili, modelele de recomandare și detectoarele în timp real se bazează adesea pe informații distilate pentru studenți, care păstrează cea mai mare parte a preciziei profesorului la o fracțiune din cost.
Comments (2)
Leave a comment