EN - FR - DE - ES - IT - PT -

LexiconDream

✂️ Tokenisatie

Het splitsen van tekst in kleinere eenheden, tokens genoemd.

Tokenisatie

Voordat een taalmodel iets kan lezen, moet de tekst worden opgedeeld in stukjes die het kan tellen. Die stukjes zijn tokens, en tokenisatie is het proces van opdelen. Een token kan een heel woord zijn, een fragment zoals "ing" of "pre", een leesteken of zelfs een enkel teken. Het model ziet nooit de onbewerkte tekst; het ziet een reeks integer-ID's die aan die tokens zijn gekoppeld.

Verschillende methoden brengen verschillende afwegingen met zich mee. Tokenisatie op woordniveau behoudt de betekenis, maar leidt tot miljoenen zeldzame woorden en heeft moeite met typefouten. Tokenisatie op karakterniveau heeft een kleine woordenschat, maar produceert zeer lange reeksen. Subwoordmethoden zoals byte-pair-codering zitten daar tussenin: ze beginnen met karakters en voegen herhaaldelijk de meest voorkomende paren samen totdat een bepaalde woordenschatgrootte is bereikt.

Waarom het belangrijk is

Een zin in het Engels kan 20 tokens gebruiken; dezelfde zin in het Thais of Hindi kan er 60 of meer nodig hebben onder een op het Westen georiënteerde tokenizer. Deze onbalans heeft gevolgen voor de snelheid, de prijs en de nauwkeurigheid voor miljarden sprekers.

Comments

No comments yet. Be the first to share a thought.

Leave a comment