EN - FR - DE - ES - IT - PT -

LexiconDream

✂️ Tokenisierung

Das Zerlegen von Text in kleinere Einheiten, Tokens genannt.

Tokenisierung

Bevor ein Sprachmodell Text lesen kann, muss dieser in zählbare Einheiten zerlegt werden. Diese Einheiten werden Tokens genannt, und die Tokenisierung ist der Zerlegungsprozess. Ein Token kann ein ganzes Wort, ein Fragment wie „ing“ oder „pre“, ein Satzzeichen oder sogar ein einzelnes Zeichen sein. Das Modell sieht niemals den Rohtext, sondern eine Folge von ganzzahligen IDs, die diesen Tokens zugeordnet sind.

Verschiedene Verfahren bringen unterschiedliche Vor- und Nachteile mit sich. Die Tokenisierung auf Wortebene erhält die Bedeutung, führt aber zu Millionen seltener Wörter und ist anfällig für Tippfehler. Die Tokenisierung auf Zeichenebene hat einen sehr kleinen Wortschatz, erzeugt aber sehr lange Sequenzen. Teilwortverfahren wie die Bytepaar-Kodierung liegen dazwischen: Sie beginnen mit Zeichen und führen wiederholt die häufigsten Paare zusammen, bis eine Zielwortschatzgröße erreicht ist.

Warum es wichtig ist

Ein englischer Satz benötigt etwa 20 Tokens; derselbe Satz im Thailändischen oder Hindi kann mit einem westlich geprägten Tokenizer 60 oder mehr Tokens erfordern. Dieses Ungleichgewicht beeinträchtigt Geschwindigkeit, Preis und Genauigkeit für Milliarden von Sprechern.

Comments

No comments yet. Be the first to share a thought.

Leave a comment