La tokenisation est l'étape préalable au traitement de texte dans un modèle de langage : elle consiste à diviser une séquence de caractères en unités discrètes appelées tokens, que le modèle convertit ensuite en valeurs numériques. Un token ne correspond pas nécessairement à un mot ; il peut s'agir d'un mot complet, d'un fragment de mot (sous-mot), d'un signe de ponctuation ou même d'un seul caractère, selon l'algorithme employé.
Elle est importante car elle conditionne à la fois les performances et le coût. Les modèles ont une limite de fenêtre de contexte mesurée en tokens, et de nombreux services facturent selon cette unité. De plus, une bonne stratégie de tokenisation permet de gérer les mots inconnus sans les écarter. Les méthodes les plus courantes sont :
- BPE (Byte Pair Encoding), utilisé dans la famille GPT.
- WordPiece, employé par BERT.
- SentencePiece, fréquent dans les modèles multilingues.
Une nuance pratique : en français, les mots longs ou peu communs peuvent être fragmentés en plusieurs tokens, c'est pourquoi un même texte consomme souvent plus de tokens que son équivalent en anglais, ce qui affecte le coût et l'espace disponible dans le contexte.