Das Kontextfenster ist die maximale Informationsmenge, die ein Sprachmodell gleichzeitig verarbeiten kann, einschließlich sowohl der Benutzereingabe als auch der generierten Antwort. Es wird in Tokens gemessen, den kleinsten Einheiten, in die das Modell den Text zerlegt (ein Token entspricht etwa drei Vierteln eines Wortes im Deutschen). Beispielsweise ermöglicht ein Fenster von 128.000 Tokens die Verarbeitung des Äquivalents eines kurzen Buches in einer einzigen Interaktion.
Seine Größe ist von Bedeutung, da sie bestimmt, wie viel das Modell innerhalb einer Konversation oder eines Dokuments „behält“. Wenn der Austausch das Limit überschreitet, wird der älteste Inhalt verworfen oder gekürzt, was dazu führen kann, dass das Modell Anweisungen oder Details „vergisst“, die zu Beginn gegeben wurden.
In der Praxis sollte beachtet werden, dass:
- Ein großes Fenster garantiert nicht, dass das Modell alle Informationen optimal nutzt; es schenkt dem Anfang und dem Ende meist mehr Aufmerksamkeit.
- Die Verarbeitung von mehr Tokens erhöht die Kosten und die Latenz jeder Abfrage.
Daher empfiehlt es sich, den Kontext zusammenzufassen oder zu strukturieren, anstatt ihn zu überladen.