O tokenmaxxing consiste em aproveitar ao máximo a janela de contexto de um modelo de linguagem, ou seja, o número total de tokens que pode processar numa única interação. A ideia é introduzir tanta informação relevante quanto possível — documentos, exemplos, instruções detalhadas ou históricos completos — para que o modelo disponha de todo o material necessário antes de gerar a sua resposta.
Esta prática é importante porque a qualidade das respostas costuma depender mais do contexto disponível do que da astúcia do prompt. Carregar o contexto com dados pertinentes reduz as alucinações e evita ter de dividir tarefas complexas em múltiplas chamadas. Resulta especialmente útil em:
- Análise de documentos longos ou bases de código inteiras.
- Prompts com muitos exemplos (few-shot extenso).
- Conversas que requerem manter um histórico amplo.
Convém uma ressalva: mais tokens nem sempre equivalem a melhores resultados. Os modelos sofrem o fenómeno lost in the middle, prestando menos atenção à informação situada no centro do contexto. Por isso, o tokenmaxxing eficaz combina quantidade com uma estrutura clara que dê prioridade aos dados críticos no início ou no fim.