Os modelos grandes aprendem bem, mas são lentos. Os modelos pequenos são rápidos, mas aprendem menos. A destilação de conhecimento encontra um meio-termo, treinando um modelo aluno compacto para imitar um modelo professor maior, usando as previsões indiretas do professor em vez de apenas rótulos rígidos.
As previsões flexíveis transportam mais informações. Quando um professor atribui 70% de probabilidade a "gato" e 25% a "cão", o aluno aprende que os gatos e os cães partilham características. Rótulos rígidos indicariam apenas "gato". Este sinal extra ajuda o aluno a generalizar melhor do que o treino baseado apenas em rótulos.
variantes comuns de destilação
- Destilação baseada na resposta a partir de logits de saída
- Destilação baseada em características a partir de camadas intermédias
- Destilação baseada em relações a partir de relações de camadas
- Autodestilação dentro da mesma arquitetura
Esta técnica é a base de muitos sistemas de produção. Os assistentes móveis, os modelos de recomendação e os detetores em tempo real dependem frequentemente de alunos otimizados que retêm a maior parte da precisão do professor a um custo muito mais baixo.
Comments (2)
Leave a comment