Numerele cu virgulă mobilă sunt precise, dar grele. Cuantizarea reduce precizia numerică a ponderilor și activărilor modelului, de obicei de la numere cu virgulă mobilă pe 32 de biți la numere întregi pe 8 sau 4 biți. Modelul se micșorează, rulează mai rapid și consumă mai puțină energie.
Compromisul este acuratețea. Cuantizarea agresivă degradează calitatea rezultatului, în special în sarcinile care necesită distincții numerice fine. Cuantizarea post-antrenament este ieftină, dar cu pierderi. Antrenamentul conștient de cuantizare simulează o precizie scăzută în timpul antrenamentului, recuperând o mare parte din acuratețea pierdută.
Niveluri comune de cuantizare
- virgulă mobilă pe 16 biți, compresie minoră
- Întreg pe 8 biți, utilizat pe scară largă pentru inferență
- Întreg pe 4 biți, agresiv, dar fezabil cu grijă
- Binar și ternar, experimental
Suportul hardware variază. Unele acceleratoare gestionează nativ 8 biți și oferă creșteri mari de viteză. Altele recurg la căi mai lente. Alegerea unei scheme de cuantizare depinde la fel de mult de ținta implementării, cât și de model.
Comments
No comments yet. Be the first to share a thought.
Leave a comment