Die Tokenisierung ist der vorbereitende Schritt zur Textverarbeitung in einem Sprachmodell: Sie besteht darin, eine Zeichenfolge in diskrete Einheiten, sogenannte Tokens, zu unterteilen, die das Modell anschließend in numerische Werte umwandelt. Ein Token entspricht nicht zwangsläufig einem Wort; es kann ein vollständiges Wort, ein Wortfragment (Subword), ein Satzzeichen oder sogar ein einzelnes Zeichen sein, abhängig vom verwendeten Algorithmus.
Sie ist von Bedeutung, da sie sowohl die Leistung als auch die Kosten beeinflusst. Modelle verfügen über eine in Tokens gemessene Begrenzung des Kontextfensters, und viele Dienste rechnen nach dieser Einheit ab. Zudem ermöglicht eine gute Tokenisierungsstrategie den Umgang mit unbekannten Wörtern, ohne diese zu verwerfen. Die gängigsten Methoden sind:
- BPE (Byte Pair Encoding), verwendet in der GPT-Familie.
- WordPiece, eingesetzt von BERT.
- SentencePiece, häufig in mehrsprachigen Modellen.
Ein praktischer Aspekt: Im Spanischen können lange oder ungewöhnliche Wörter in mehrere Tokens fragmentiert werden, weshalb derselbe Text oft mehr Tokens verbraucht als seine englische Entsprechung, was sich auf die Kosten und den verfügbaren Platz im Kontext auswirkt.