NAiOS Wiki

Tokenización

También: Tokenización · Tokenizer · Tokenización de texto · Segmentación en tokens

Proceso de división del texto en unidades (tokens) que el modelo puede procesar

1 min de lectura

A tokenización é o paso previo ao procesamento de texto nun modelo de linguaxe: consiste en dividir unha secuencia de caracteres en unidades discretas chamadas tokens, que o modelo converte despois en valores numéricos. Un token non equivale necesariamente a unha palabra; pode ser unha palabra completa, un fragmento de palabra (subpalabra), un signo de puntuación ou incluso un só carácter, segundo o algoritmo empregado.

Importa porque condiciona tanto o rendemento como o custo. Os modelos teñen un límite de xanela de contexto medido en tokens, e moitos servizos facturan por esta unidade. Ademais, unha boa estratexia de tokenización permite manexar palabras descoñecidas sen descartalas. Os métodos máis habituais son:

  • BPE (Byte Pair Encoding), usado na familia GPT.
  • WordPiece, empregado por BERT.
  • SentencePiece, frecuente en modelos multilingües.

Un matiz práctico: en castelán, palabras longas ou pouco comúns poden fragmentarse en varios tokens, polo que un mesmo texto adoita consumir máis tokens que o seu equivalente en inglés, afectando ao custo e ao espazo dispoñible no contexto.

¿Quieres profundizar?

Lee nuestros artículos sobre IA aplicada en el blog de NAiOS.

Ir al Blog