Modelos grandes vencem benchmarks. Modelos pequenos são lançados. A compressão de modelos reduz o tamanho e o custo computacional, preservando a maior parte da precisão original, o que torna a implementação viável em telemóveis, dispositivos embebidos e servidores com orçamento limitado.
Diversas técnicas combinam-se. A poda remove pesos que pouco contribuem. A quantização reduz a precisão numérica. A destilação treina um aluno mais pequeno. A fatorização de baixa classificação decompõe as matrizes de pesos. Na prática, os engenheiros empilham estes métodos.
Métodos de compressão comuns
- Podar pesos ou neurónios desnecessários
- Quantização para 8 bits ou menos
- Simplificação do conhecimento para os alunos menores
- Decomposição de matrizes de baixa classificação
- Na área da arquitetura procuram-se projetos eficientes.
A compressão tem limites. A precisão degrada-se e os métodos agressivos podem alterar o comportamento de formas que só aparecem em entradas raras. A comparação com dados representativos antes e depois da compressão é essencial.
Comments
No comments yet. Be the first to share a thought.
Leave a comment