A janela de contexto é a quantidade máxima de informação que um modelo de linguagem pode processar de forma simultânea, incluindo tanto a entrada do utilizador como a resposta que gera. Mede-se em tokens, as unidades mínimas em que o modelo decompõe o texto (um token equivale aproximadamente a três quartos de uma palavra em português). Por exemplo, uma janela de 128.000 tokens permite gerir o equivalente a um livro curto numa única interação.
O seu tamanho importa porque determina quanto o modelo «recorda» dentro de uma conversa ou documento. Se a troca superar o limite, o conteúdo mais antigo é descartado ou truncado, o que pode fazer com que o modelo «esqueça» instruções ou detalhes fornecidos no início.
Na prática, convém ter em conta que:
- Uma janela grande não garante que o modelo utilize bem toda a informação; costuma prestar mais atenção ao início e ao fim.
- Processar mais tokens aumenta o custo e a latência de cada consulta.
Por isso, é recomendável resumir ou estruturar o contexto em vez de o saturar.