Gleitkommazahlen sind präzise, aber speicherintensiv. Durch Quantisierung wird die numerische Genauigkeit der Modellgewichte und Aktivierungen reduziert, typischerweise von 32-Bit-Gleitkommazahlen auf 8-Bit- oder 4-Bit-Ganzzahlen. Das Modell wird dadurch kleiner, läuft schneller und benötigt weniger Energie.
Der Kompromiss liegt in der Genauigkeit. Aggressive Quantisierung verschlechtert die Ausgabequalität, insbesondere bei Aufgaben, die feine numerische Unterscheidungen erfordern. Quantisierung nach dem Training ist zwar kostengünstig, aber verlustbehaftet. Quantisierungsbewusstes Training simuliert eine geringe Präzision während des Trainings und stellt so einen Großteil der verlorenen Genauigkeit wieder her.
Gängige Quantisierungsstufen
- 16-Bit-Gleitkomma, geringe Komprimierung
- 8-Bit-Ganzzahl, weit verbreitet für Inferenz.
- 4-Bit-Ganzzahl, aggressiv, aber mit Vorsicht machbar
- Binär und ternär, experimentell
Die Hardwareunterstützung variiert. Einige Beschleuniger verarbeiten 8-Bit nativ und erzielen dadurch deutliche Geschwindigkeitssteigerungen. Andere greifen auf langsamere Verfahren zurück. Die Wahl des Quantisierungsverfahrens hängt sowohl vom Zielsystem als auch vom verwendeten Modell ab.
Comments
No comments yet. Be the first to share a thought.
Leave a comment