Sebelum model bahasa dapat membaca apa pun, teks harus dipecah menjadi bagian-bagian yang dapat dihitung. Bagian-bagian tersebut adalah token, dan tokenisasi adalah proses pemecahannya. Sebuah token bisa berupa kata utuh, fragmen seperti "ing" atau "pre", tanda baca, atau bahkan satu karakter. Model tersebut tidak pernah melihat teks mentah; ia melihat urutan ID bilangan bulat yang dipetakan ke token-token tersebut.
Skema yang berbeda menghasilkan kompromi yang berbeda. Tokenisasi tingkat kata mempertahankan makna tetapi menghasilkan jutaan kata langka dan kesulitan dengan kesalahan ketik. Tokenisasi tingkat karakter memiliki kosakata yang sangat kecil tetapi menghasilkan urutan yang sangat panjang. Metode subkata seperti pengkodean pasangan byte berada di antaranya: metode ini dimulai dengan karakter dan berulang kali menggabungkan pasangan yang paling sering muncul hingga ukuran kosakata target tercapai.
Mengapa ini penting
- Ukuran kosakata menentukan tabel penyematan model dan jejak memori.
- Jumlah token menentukan jendela konteks dan biaya setiap panggilan API.
- Tokenisasi yang buruk memecah kata-kata dengan cara yang merugikan kinerja multibahasa.
- Bahasa dengan aksara non-Latin seringkali membutuhkan lebih banyak token per kalimat.
Sebuah kalimat dalam bahasa Inggris mungkin menggunakan 20 token; kalimat yang sama dalam bahasa Thailand atau Hindi dapat membutuhkan 60 token atau lebih di bawah tokenizer yang berpusat pada budaya Barat. Ketidakseimbangan itu memengaruhi kecepatan, harga, dan akurasi bagi miliaran penutur bahasa.
Comments
No comments yet. Be the first to share a thought.
Leave a comment