EN - FR - DE - ES - IT - PT -

LexiconDream

✂️ Tokenisasi

Proses membagi teks menjadi unit-unit yang lebih kecil yang disebut token.

Tokenisasi

Sebelum model bahasa dapat membaca apa pun, teks harus dipecah menjadi bagian-bagian yang dapat dihitung. Bagian-bagian tersebut adalah token, dan tokenisasi adalah proses pemecahannya. Sebuah token bisa berupa kata utuh, fragmen seperti "ing" atau "pre", tanda baca, atau bahkan satu karakter. Model tersebut tidak pernah melihat teks mentah; ia melihat urutan ID bilangan bulat yang dipetakan ke token-token tersebut.

Skema yang berbeda menghasilkan kompromi yang berbeda. Tokenisasi tingkat kata mempertahankan makna tetapi menghasilkan jutaan kata langka dan kesulitan dengan kesalahan ketik. Tokenisasi tingkat karakter memiliki kosakata yang sangat kecil tetapi menghasilkan urutan yang sangat panjang. Metode subkata seperti pengkodean pasangan byte berada di antaranya: metode ini dimulai dengan karakter dan berulang kali menggabungkan pasangan yang paling sering muncul hingga ukuran kosakata target tercapai.

Mengapa ini penting

Sebuah kalimat dalam bahasa Inggris mungkin menggunakan 20 token; kalimat yang sama dalam bahasa Thailand atau Hindi dapat membutuhkan 60 token atau lebih di bawah tokenizer yang berpusat pada budaya Barat. Ketidakseimbangan itu memengaruhi kecepatan, harga, dan akurasi bagi miliaran penutur bahasa.

Comments

No comments yet. Be the first to share a thought.

Leave a comment