O tokenmaxxing consiste en aproveitar ao máximo a xanela de contexto dun modelo de linguaxe, é dicir, o número total de tokens que pode procesar nunha soa interacción. A idea é introducir tanta información relevante como sexa posible —documentos, exemplos, instrucións detalladas ou historiais completos— para que o modelo dispoña de todo o material necesario antes de xerar a súa resposta.
Esta práctica importa porque a calidade das respostas adoita depender máis do contexto dispoñible que da astucia do prompt. Cargar o contexto con datos pertinentes reduce as alucinacións e evita ter que dividir tarefas complexas en múltiples chamadas. Resulta especialmente útil en:
- Análise de documentos longos ou bases de código enteiras.
- Prompts con moitos exemplos (few-shot extenso).
- Conversas que requiren manter un historial amplo.
Cómpre un matiz: máis tokens non sempre equivale a mellores resultados. Os modelos sofren o fenómeno lost in the middle, prestando menos atención á información situada no centro do contexto. Por iso o tokenmaxxing eficaz combina cantidade cunha estrutura clara que priorice os datos críticos ao principio ou ao final.