EN - FR - DE - ES - IT - PT -

LexiconDream

🔢 Quantisierung

Verringerung der Genauigkeit der Modellparameter, um Speicher und Rechenaufwand zu senken.

Quantisierung

Gleitkommazahlen sind präzise, ​​aber speicherintensiv. Durch Quantisierung wird die numerische Genauigkeit der Modellgewichte und Aktivierungen reduziert, typischerweise von 32-Bit-Gleitkommazahlen auf 8-Bit- oder 4-Bit-Ganzzahlen. Das Modell wird dadurch kleiner, läuft schneller und benötigt weniger Energie.

Der Kompromiss liegt in der Genauigkeit. Aggressive Quantisierung verschlechtert die Ausgabequalität, insbesondere bei Aufgaben, die feine numerische Unterscheidungen erfordern. Quantisierung nach dem Training ist zwar kostengünstig, aber verlustbehaftet. Quantisierungsbewusstes Training simuliert eine geringe Präzision während des Trainings und stellt so einen Großteil der verlorenen Genauigkeit wieder her.

Gängige Quantisierungsstufen

Die Hardwareunterstützung variiert. Einige Beschleuniger verarbeiten 8-Bit nativ und erzielen dadurch deutliche Geschwindigkeitssteigerungen. Andere greifen auf langsamere Verfahren zurück. Die Wahl des Quantisierungsverfahrens hängt sowohl vom Zielsystem als auch vom verwendeten Modell ab.

Comments

No comments yet. Be the first to share a thought.

Leave a comment