EN - FR - DE - ES - IT - PT -

LexiconDream

✂️ Tokenização

O processo de dividir texto em unidades menores chamadas tokens.

Tokenização

Antes de um modelo de linguagem poder ler o que quer que seja, o texto precisa de ser dividido em partes que possa contar. Estas partes são tokens, e a tokenização é o processo de divisão. Um token pode ser uma palavra inteira, um fragmento como "ndo" ou "pré", um sinal de pontuação ou até um único caractere. O modelo nunca vê o texto em bruto; vê uma sequência de IDs inteiros mapeados para esses tokens.

Diferentes métodos apresentam diferentes vantagens e desvantagens. A tokenização ao nível da palavra preserva o significado, mas resulta em milhões de palavras raras e apresenta dificuldades com gralhas. A tokenização ao nível do caractere possui um vocabulário muito pequeno, mas produz sequências muito longas. Os métodos de subpalavras, como a codificação de pares de bytes, situam-se entre estes dois extremos: começam com caracteres e combinam repetidamente os pares mais frequentes até atingir o tamanho de vocabulário desejado.

Por que razão isso importa

Uma frase em inglês pode utilizar 20 tokens; a mesma frase em tailandês ou hindi pode exigir 60 ou mais num tokenizador com foco no Ocidente. Este desequilíbrio afeta a velocidade, o preço e a precisão para milhares de milhões de falantes.

Comments

No comments yet. Be the first to share a thought.

Leave a comment