Bilangan floating point memang presisi tetapi berat. Kuantisasi mengurangi presisi numerik bobot dan aktivasi model, biasanya dari floating point 32-bit menjadi bilangan bulat 8-bit atau 4-bit. Model menjadi lebih kecil, berjalan lebih cepat, dan menggunakan daya lebih sedikit.
Komprominya adalah akurasi. Kuantisasi agresif menurunkan kualitas output, terutama pada tugas-tugas yang membutuhkan perbedaan numerik yang halus. Kuantisasi pasca-pelatihan murah tetapi merugikan. Pelatihan yang sadar akan kuantisasi mensimulasikan presisi rendah selama pelatihan, memulihkan sebagian besar akurasi yang hilang.
Tingkat kuantisasi umum
- Bilangan floating point 16-bit, kompresi minor
- Bilangan bulat 8-bit, banyak digunakan untuk inferensi.
- Bilangan bulat 4-bit, agresif tetapi dapat dilakukan dengan hati-hati.
- Biner dan terner, eksperimental
Dukungan perangkat keras bervariasi. Beberapa akselerator menangani 8-bit secara native dan memberikan peningkatan kecepatan yang besar. Yang lain menggunakan jalur yang lebih lambat. Pemilihan skema kuantisasi bergantung pada target penerapan dan juga pada modelnya.
Comments
No comments yet. Be the first to share a thought.
Leave a comment