Πριν ένα γλωσσικό μοντέλο μπορέσει να διαβάσει οτιδήποτε, το κείμενο πρέπει να τεμαχιστεί σε κομμάτια που να μπορούν να μετρηθούν. Αυτά τα κομμάτια είναι τα tokens, και η μετατροπή σε tokens είναι ο τεμαχισμός. Ένα token μπορεί να είναι μια ολόκληρη λέξη, ένα τμήμα όπως "ing" ή "pre", ένα σημείο στίξης ή ακόμα και ένας μόνο χαρακτήρας. Το μοντέλο δεν βλέπει ποτέ ακατέργαστο κείμενο. Βλέπει μια ακολουθία ακεραίων ID που αντιστοιχίζονται σε αυτά τα tokens.
Διαφορετικά σχήματα κάνουν διαφορετικούς συμβιβασμούς. Η μετατροπή σε επίπεδο λέξης διατηρεί το νόημα άθικτο, αλλά εκρήγνυται σε εκατομμύρια σπάνιες λέξεις και δυσκολεύεται με τυπογραφικά λάθη. Η μετατροπή σε επίπεδο χαρακτήρα έχει ένα μικρό λεξιλόγιο, αλλά παράγει πολύ μεγάλες ακολουθίες. Οι μέθοδοι υπολέξεων, όπως η κωδικοποίηση ζευγών byte, βρίσκονται ενδιάμεσα: ξεκινούν με χαρακτήρες και συγχωνεύουν επανειλημμένα τα πιο συχνά ζεύγη μέχρι να επιτευχθεί ένα μέγεθος λεξιλογίου-στόχου.
Γιατί έχει σημασία
- Το μέγεθος του λεξιλογίου καθορίζει τον πίνακα ενσωμάτωσης και το αποτύπωμα μνήμης του μοντέλου
- Το Token count ορίζει το παράθυρο περιβάλλοντος και το κόστος κάθε κλήσης API
- Η κακή διακριτικοποίηση διαιρεί τις λέξεις με τρόπους που βλάπτουν την πολυγλωσσική απόδοση
- Οι γλώσσες με μη λατινικά αλφάβητα συχνά χρειάζονται πολύ περισσότερα tokens ανά πρόταση
Μια πρόταση στα αγγλικά μπορεί να χρησιμοποιεί 20 tokens. Η ίδια πρόταση στα ταϊλανδέζικα ή τα χίντι μπορεί να έχει 60 ή περισσότερα σε ένα tokenizer με δυτικό επίκεντρο. Αυτή η ανισορροπία επηρεάζει την ταχύτητα, την τιμή και την ακρίβεια για δισεκατομμύρια ομιλητές.
Comments
No comments yet. Be the first to share a thought.
Leave a comment