Flydende tal er præcise, men tunge. Kvantisering reducerer den numeriske præcision af modelvægte og aktiveringer, typisk fra 32-bit flydende tal til 8-bit eller 4-bit heltal. Modellen krymper, kører hurtigere og bruger mindre strøm.
Ulempen er nøjagtighed. Aggressiv kvantisering forringer outputkvaliteten, især på opgaver, der kræver fine numeriske distinktioner. Kvantisering efter træning er billig, men tabsgivende. Kvantiseringsbevidst træning simulerer lav præcision under træning og genvinder meget af den tabte nøjagtighed.
Almindelige kvantiseringsniveauer
- 16-bit flydende komma, mindre komprimering
- 8-bit heltal, meget brugt til inferens
- 4-bit heltal, aggressivt men muligt med forsigtighed
- Binær og ternær, eksperimentel
Hardwareunderstøttelsen varierer. Nogle acceleratorer håndterer 8-bit native og leverer store hastighedsforøgelser. Andre bruger langsommere stier. Valg af kvantiseringsskema afhænger lige så meget af implementeringsmålet som af modellen.
Comments
No comments yet. Be the first to share a thought.
Leave a comment