EN - FR - DE - ES - IT - PT -

LexiconDream

✂️ Tokenization

Η διαδικασία διαίρεσης κειμένου σε μικρότερες μονάδες που ονομάζονται διακριτικά.

Tokenization

Πριν ένα γλωσσικό μοντέλο μπορέσει να διαβάσει οτιδήποτε, το κείμενο πρέπει να τεμαχιστεί σε κομμάτια που να μπορούν να μετρηθούν. Αυτά τα κομμάτια είναι τα tokens, και η μετατροπή σε tokens είναι ο τεμαχισμός. Ένα token μπορεί να είναι μια ολόκληρη λέξη, ένα τμήμα όπως "ing" ή "pre", ένα σημείο στίξης ή ακόμα και ένας μόνο χαρακτήρας. Το μοντέλο δεν βλέπει ποτέ ακατέργαστο κείμενο. Βλέπει μια ακολουθία ακεραίων ID που αντιστοιχίζονται σε αυτά τα tokens.

Διαφορετικά σχήματα κάνουν διαφορετικούς συμβιβασμούς. Η μετατροπή σε επίπεδο λέξης διατηρεί το νόημα άθικτο, αλλά εκρήγνυται σε εκατομμύρια σπάνιες λέξεις και δυσκολεύεται με τυπογραφικά λάθη. Η μετατροπή σε επίπεδο χαρακτήρα έχει ένα μικρό λεξιλόγιο, αλλά παράγει πολύ μεγάλες ακολουθίες. Οι μέθοδοι υπολέξεων, όπως η κωδικοποίηση ζευγών byte, βρίσκονται ενδιάμεσα: ξεκινούν με χαρακτήρες και συγχωνεύουν επανειλημμένα τα πιο συχνά ζεύγη μέχρι να επιτευχθεί ένα μέγεθος λεξιλογίου-στόχου.

Γιατί έχει σημασία

Μια πρόταση στα αγγλικά μπορεί να χρησιμοποιεί 20 tokens. Η ίδια πρόταση στα ταϊλανδέζικα ή τα χίντι μπορεί να έχει 60 ή περισσότερα σε ένα tokenizer με δυτικό επίκεντρο. Αυτή η ανισορροπία επηρεάζει την ταχύτητα, την τιμή και την ακρίβεια για δισεκατομμύρια ομιλητές.


Warning: session_start(): Cannot start session when headers already sent in /var/www/lexicondream.com/inc/functions.php on line 63

Comments

No comments yet. Be the first to share a thought.

Leave a comment