Les nombres à virgule flottante sont précis mais gourmands en ressources. La quantification réduit la précision numérique des poids et des activations du modèle, généralement de nombres à virgule flottante 32 bits à des entiers 8 ou 4 bits. Le modèle est ainsi plus compact, plus rapide et consomme moins d'énergie.
Le compromis réside dans la précision. Une quantification trop poussée dégrade la qualité des résultats, notamment pour les tâches exigeant des distinctions numériques fines. La quantification post-entraînement est peu coûteuse mais entraîne une perte d'information. L'entraînement prenant en compte la quantification simule une faible précision pendant l'entraînement, récupérant ainsi une grande partie de la précision perdue.
niveaux de quantification courants
- Virgule flottante 16 bits, compression mineure
- Entier 8 bits, largement utilisé pour l'inférence
- Entier 4 bits, agressif mais réalisable avec précaution
- Binaire et ternaire, expérimental
La prise en charge matérielle varie. Certains accélérateurs gèrent nativement le 8 bits et offrent des gains de vitesse importants. D'autres utilisent des méthodes moins performantes. Le choix d'un schéma de quantification dépend autant de la cible de déploiement que du modèle.
Comments
No comments yet. Be the first to share a thought.
Leave a comment