Bevor ein Sprachmodell Text lesen kann, muss dieser in zählbare Einheiten zerlegt werden. Diese Einheiten werden Tokens genannt, und die Tokenisierung ist der Zerlegungsprozess. Ein Token kann ein ganzes Wort, ein Fragment wie „ing“ oder „pre“, ein Satzzeichen oder sogar ein einzelnes Zeichen sein. Das Modell sieht niemals den Rohtext, sondern eine Folge von ganzzahligen IDs, die diesen Tokens zugeordnet sind.
Verschiedene Verfahren bringen unterschiedliche Vor- und Nachteile mit sich. Die Tokenisierung auf Wortebene erhält die Bedeutung, führt aber zu Millionen seltener Wörter und ist anfällig für Tippfehler. Die Tokenisierung auf Zeichenebene hat einen sehr kleinen Wortschatz, erzeugt aber sehr lange Sequenzen. Teilwortverfahren wie die Bytepaar-Kodierung liegen dazwischen: Sie beginnen mit Zeichen und führen wiederholt die häufigsten Paare zusammen, bis eine Zielwortschatzgröße erreicht ist.
Warum es wichtig ist
- Die Vokabulargröße bestimmt die Einbettungstabelle und den Speicherbedarf des Modells.
- Die Anzahl der Tokens bestimmt das Kontextfenster und die Kosten jedes API-Aufrufs.
- Eine mangelhafte Tokenisierung zerlegt Wörter auf eine Weise, die die mehrsprachige Leistung beeinträchtigt.
- Sprachen mit nicht-lateinischen Schriften benötigen oft weitaus mehr Token pro Satz.
Ein englischer Satz benötigt etwa 20 Tokens; derselbe Satz im Thailändischen oder Hindi kann mit einem westlich geprägten Tokenizer 60 oder mehr Tokens erfordern. Dieses Ungleichgewicht beeinträchtigt Geschwindigkeit, Preis und Genauigkeit für Milliarden von Sprechern.
Comments
No comments yet. Be the first to share a thought.
Leave a comment