Zwevende-kommagetallen zijn nauwkeurig, maar zwaar. Kwantisatie vermindert de numerieke precisie van modelgewichten en activaties, doorgaans van 32-bits zwevende-kommagetallen naar 8-bits of 4-bits gehele getallen. Het model wordt kleiner, werkt sneller en verbruikt minder energie.
De afweging is nauwkeurigheid. Agressieve kwantisering vermindert de kwaliteit van de uitvoer, vooral bij taken die fijne numerieke onderscheidingen vereisen. Kwantisering na de training is goedkoop, maar gaat gepaard met verlies van nauwkeurigheid. Kwantiseringsbewuste training simuleert een lage precisie tijdens de training, waardoor een groot deel van de verloren nauwkeurigheid wordt hersteld.
Gangbare kwantiseringsniveaus
- 16-bits drijvende-komma, lichte compressie
- 8-bits integer, veel gebruikt voor inferentie
- 4-bits integer, ambitieus maar haalbaar met de nodige voorzichtigheid.
- Binair en ternair, experimenteel
Hardwareondersteuning varieert. Sommige accelerators ondersteunen 8-bit native en leveren aanzienlijke snelheidsverbeteringen op. Andere vallen terug op tragere methoden. De keuze voor een kwantiseringsschema hangt evenzeer af van het beoogde gebruik als van het model.
Comments
No comments yet. Be the first to share a thought.
Leave a comment