NAiOS IconNAiOS Logo
NAiOS Wiki

Tokenisation

También: Tokenisation · Tokenizer · Tokenisation de texte · Segmentation en tokens

Processus de division du texte en unités (tokens) que le modèle peut traiter.

1 min de lectura

La tokenisation est l'étape préalable au traitement de texte dans un modèle de langage : elle consiste à diviser une séquence de caractères en unités discrètes appelées tokens, que le modèle convertit ensuite en valeurs numériques. Un token ne correspond pas nécessairement à un mot ; il peut s'agir d'un mot complet, d'un fragment de mot (sous-mot), d'un signe de ponctuation ou même d'un seul caractère, selon l'algorithme employé.

Elle est importante car elle conditionne à la fois les performances et le coût. Les modèles ont une limite de fenêtre de contexte mesurée en tokens, et de nombreux services facturent selon cette unité. De plus, une bonne stratégie de tokenisation permet de gérer les mots inconnus sans les écarter. Les méthodes les plus courantes sont :

  • BPE (Byte Pair Encoding), utilisé dans la famille GPT.
  • WordPiece, employé par BERT.
  • SentencePiece, fréquent dans les modèles multilingues.

Une nuance pratique : en français, les mots longs ou peu communs peuvent être fragmentés en plusieurs tokens, c'est pourquoi un même texte consomme souvent plus de tokens que son équivalent en anglais, ce qui affecte le coût et l'espace disponible dans le contexte.

¿Quieres profundizar?

Lee nuestros artículos sobre IA aplicada en el blog de NAiOS.

Ir al Blog