EN - FR - DE - ES - IT - PT -

LexiconDream

🧪 Destilace znalostí

Trénování malého modelu pro napodobení chování většího modelu.

Destilace znalostí

Velké modely se učí dobře, ale běží pomalu. Malé modely běží rychle, ale učí se méně. Destilace znalostí rozděluje rozdíl tím, že trénuje kompaktní studentský model tak, aby napodoboval většího učitele, a to s využitím měkkých předpovědí učitele, nikoli pouze tvrdých popisků.

Měkké predikce nesou více informací. Když učitel přiřadí 70% pravděpodobnost kočce a 25% psovi, student se dozví, že kočka a pes sdílejí rysy. Tvrdé předpovědi by říkaly pouze kočka. Tento dodatečný signál pomáhá studentovi lépe zobecňovat než trénování pouze na základě označení.

Běžné varianty destilace

Tato technika je základem mnoha produkčních systémů. Mobilní asistenti, modely doporučení a detektory v reálném čase se často spoléhají na destilované studenty, kteří si zachovávají většinu přesnosti učitele za zlomek nákladů.

Comments (2)

  1. Robert Ashford
    Knowledge distillation is how you compress a large model into a smaller one without losing too much performance. Useful for deployment.
  2. Nadia F.
    The article is clear. Training a small model to mimic the behavior of a larger model. Simple but important in AI.

Leave a comment