Le tokenmaxxing consiste à exploiter au maximum la fenêtre de contexte d'un modèle de langage, c'est-à-dire le nombre total de tokens qu'il peut traiter en une seule interaction. L'idée est d'introduire autant d'informations pertinentes que possible — documents, exemples, instructions détaillées ou historiques complets — afin que le modèle dispose de tout le matériel nécessaire avant de générer sa réponse.
Cette pratique est importante car la qualité des réponses dépend souvent davantage du contexte disponible que de l'astuce du prompt. Charger le contexte avec des données pertinentes réduit les hallucinations et évite d'avoir à diviser des tâches complexes en plusieurs appels. Cela s'avère particulièrement utile pour :
- L'analyse de documents longs ou de bases de code entières.
- Des prompts comportant de nombreux exemples (few-shot étendu).
- Des conversations nécessitant le maintien d'un historique étendu.
Une nuance s'impose : plus de tokens ne signifie pas toujours de meilleurs résultats. Les modèles souffrent du phénomène lost in the middle, accordant moins d'attention aux informations situées au centre du contexte. C'est pourquoi un tokenmaxxing efficace combine la quantité avec une structure claire qui donne la priorité aux données critiques au début ou à la fin.