A xanela de contexto é a cantidade máxima de información que un modelo de linguaxe pode procesar de forma simultánea, incluíndo tanto a entrada do usuario como a resposta que xera. Mídese en tokens, as unidades mínimas en que o modelo descompón o texto (un token equivale aproximadamente a tres cuartos dunha palabra en español). Por exemplo, unha xanela de 128.000 tokens permite manexar o equivalente a un libro curto nunha soa interacción.
O seu tamaño importa porque determina canto «recorda» o modelo dentro dunha conversa ou documento. Se o intercambio supera o límite, o contido máis antigo descártase ou trúncase, o que pode provocar que o modelo «esqueza» instrucións ou detalles dados ao principio.
Na práctica convén ter en conta que:
- Unha xanela grande non garante que o modelo use ben toda a información; adoita prestar máis atención ao inicio e ao final.
- Procesar máis tokens incrementa o custo e a latencia de cada consulta.
Por iso, é recomendable resumir ou estruturar o contexto en lugar de saturalo.