Velké modely se učí dobře, ale běží pomalu. Malé modely běží rychle, ale učí se méně. Destilace znalostí rozděluje rozdíl tím, že trénuje kompaktní studentský model tak, aby napodoboval většího učitele, a to s využitím měkkých předpovědí učitele, nikoli pouze tvrdých popisků.
Měkké predikce nesou více informací. Když učitel přiřadí 70% pravděpodobnost kočce a 25% psovi, student se dozví, že kočka a pes sdílejí rysy. Tvrdé předpovědi by říkaly pouze kočka. Tento dodatečný signál pomáhá studentovi lépe zobecňovat než trénování pouze na základě označení.
Běžné varianty destilace
- Destilace založená na odezvě z výstupních logitů
- Destilace z mezivrstvy založená na charakteristikách
- Destilace založená na relacích ze vztahů vrstev
- Samodestilace v rámci stejné architektury
Tato technika je základem mnoha produkčních systémů. Mobilní asistenti, modely doporučení a detektory v reálném čase se často spoléhají na destilované studenty, kteří si zachovávají většinu přesnosti učitele za zlomek nákladů.
Comments (2)
Leave a comment