Das Kontextfenster (Context Window) bezeichnet die maximale Textmenge, die ein KI-Sprachmodell gleichzeitig verarbeiten kann — gemessen in Tokens. Es umfasst die Eingabe des Nutzers, den bisherigen Gesprächsverlauf, mitgelieferte Dokumente und die erzeugte Antwort. Ist das Kontextfenster voll, kann das Modell ältere Informationen nicht mehr berücksichtigen und verliert den Faden.

Was ist das Kontextfenster?
Das Kontextfenster (englisch Context Window) bezeichnet die maximale Textmenge, die ein KI-Sprachmodell gleichzeitig verarbeiten kann — gemessen in Token. Es umfasst die Eingabe des Nutzers, den bisherigen Gesprächsverlauf, mitgelieferte Dokumente und die erzeugte Antwort. Ist das Kontextfenster voll, kann das Modell ältere Informationen nicht mehr berücksichtigen und verliert den Faden. Die Dokumentation von Anthropic zum Kontextfenster beschreibt es als das gesamte Fenster, aus dem ein Modell seine Antwort ableitet.
Grundlage ist die Funktionsweise eines Large Language Model: Es hat kein dauerhaftes Gedächtnis, sondern verarbeitet bei jeder Anfrage genau den Text, der im Kontextfenster steht. Alles, was außerhalb liegt, existiert für das Modell in diesem Moment nicht. Das Kontextfenster ist damit die zentrale Grenze dafür, wie viel Information ein Modell in einem Durchgang berücksichtigen kann — und ein wichtiges Unterscheidungsmerkmal zwischen Modellen.
Wie funktioniert das Kontextfenster?
Bevor ein Modell Text verarbeitet, wird dieser in Token zerlegt — ein Vorgang, der Tokenisierung heißt. Ein Token entspricht grob einem kurzen Wort oder Wortteil; im Deutschen sind es tendenziell mehr Token pro Wort als im Englischen. Aus dem gesamten Kontext — Prompt, Verlauf, Dokumente und Systemanweisungen — berechnet das Modell dann Token für Token seine Antwort. Auch diese Antwort belegt Platz im Fenster.
Die Größe des Kontextfensters wird in Token angegeben und unterscheidet sich stark zwischen Modellen — von einigen Tausend bis zu mehreren Hunderttausend Token bei aktuellen Spitzenmodellen. Große Kontextfenster erlauben es, ganze Verträge, Bücher oder umfangreiche Datensätze in einem Stück zu verarbeiten. Wie ein Modell Text erzeugt und dabei den Kontext nutzt, beschreibt die OpenAI-Dokumentation zur Textgenerierung.
Warum ist das Kontextfenster wichtig?
Das Kontextfenster bestimmt, welche Aufgaben ein Modell bewältigen kann. Wer ein langes Dokument zusammenfassen, mehrere Quellen vergleichen oder ein langes Gespräch führen will, braucht ausreichend Kontextkapazität. Ist das Fenster zu klein, gehen Informationen verloren: Das Modell vergisst frühere Absprachen oder übersieht Teile eines Dokuments. Der Wikipedia-Artikel zum großen Sprachmodell ordnet diese Kapazitätsgrenze in die Funktionsweise moderner KI ein.
Auch die Qualität hängt am Kontext: Selbst bei großen Fenstern verarbeiten Modelle Informationen am Anfang und Ende des Kontexts oft zuverlässiger als solche in der Mitte. Wichtige Anweisungen und Kerninformationen gehören deshalb prominent an den Anfang oder das Ende des Prompts. Dieses Wissen ist ein zentraler Baustein des Prompt-Engineering, das darauf zielt, den verfügbaren Kontext möglichst wirkungsvoll zu nutzen.
Das Kontextfenster in der Praxis
Im Arbeitsalltag zeigt sich das Kontextfenster etwa, wenn ein langer Chat plötzlich inkonsistent wird: Das Modell hat den Anfang des Gesprächs aus dem Fenster verloren. Abhilfe schafft, wichtige Zwischenstände zusammenzufassen und neu einzuspeisen oder für neue Teilaufgaben ein frisches Gespräch zu beginnen. Auch ein präziser System-Prompt, der die wichtigsten Regeln dauerhaft an den Anfang stellt, hilft, das Modell auf Kurs zu halten.
Bei der Analyse umfangreicher Unterlagen — etwa wenn eine Kanzlei lange Vertragswerke auswerten lässt — lohnt der Blick auf die Kontextgröße des eingesetzten Modells. Reicht sie nicht aus, werden Dokumente in Abschnitte geteilt oder per Retrieval Augmented Generation nur die jeweils relevanten Passagen in den Kontext geladen. So lässt sich auch mit begrenztem Fenster mit sehr großen Wissensbeständen arbeiten, ohne das Modell zu überfordern.
Kontextfenster, Kosten und Geschwindigkeit
Ein größeres Kontextfenster ist nicht in jedem Fall besser. Da die Verarbeitung nach Token abgerechnet wird, steigen mit der Menge des Kontexts auch die Kosten und häufig die Antwortzeiten. Wer bei jeder Anfrage sehr lange Dokumente mitschickt, zahlt für Token, die für die konkrete Frage vielleicht gar nicht nötig sind. Effizientes Arbeiten heißt deshalb, nur den wirklich relevanten Kontext bereitzustellen.
Um wiederkehrende Kontexte günstiger zu machen, bieten manche Anbieter Kontext-Caching an: Häufig genutzte Textteile werden zwischengespeichert und müssen nicht bei jeder Anfrage neu verarbeitet werden. In Verbindung mit gezieltem Retrieval lässt sich so ein großes Wissensangebot nutzen, ohne bei jeder Anfrage das gesamte Material durch das Fenster zu schieben. Die bewusste Steuerung des Kontexts ist damit auch eine Kostenfrage.
Grenzen und Missverständnisse
Ein verbreitetes Missverständnis ist, ein sehr großes Kontextfenster mache ein dauerhaftes Gedächtnis überflüssig. Das stimmt nicht: Sobald ein Gespräch oder eine Sitzung endet, ist der Kontext weg, sofern er nicht extern gespeichert und erneut mitgegeben wird. Ebenso wenig ersetzt ein großes Fenster aktuelles Wissen — das Modell kennt nur, was bis zu seinem Wissensstichtag im Training enthalten war und was ihm im Kontext mitgegeben wird.
Auch die Qualität leidet, wenn ein Fenster mit zu viel oder unstrukturiertem Material gefüllt wird. Zu viele nebensächliche Informationen können die eigentliche Aufgabe verwässern und das Risiko einer Halluzination erhöhen. Ein gut gefülltes Kontextfenster ist deshalb nicht das vollste, sondern das am besten kuratierte — mit den relevanten Informationen an den richtigen Stellen und ohne unnötigen Ballast.
Das Kontextfenster im Vergleich der Modelle
Weil die Fenstergröße stark variiert, ist sie ein wichtiges Kriterium bei der Modellwahl. Für kurze Chats oder einfache Textaufgaben genügt ein kleines Fenster, während die Analyse ganzer Aktenberge oder umfangreicher Codebasen von einem sehr großen Fenster profitiert. Neben der reinen Größe zählt jedoch auch, wie zuverlässig ein Modell den gesamten Kontext tatsächlich nutzt — große Fenster garantieren nicht automatisch, dass jede Information gleich gut verwertet wird.
Für viele Anwendungen ist deshalb die Kombination aus passender Fenstergröße, gezieltem Retrieval und sauberer Prompt-Struktur wirkungsvoller als das bloße Maximieren der Token-Zahl. Techniken wie Few-Shot-Prompting, bei dem Beispiele in den Kontext gelegt werden, nutzen das Fenster gezielt, um dem Modell die gewünschte Aufgabe zu verdeutlichen. So wird das Kontextfenster vom bloßen Speicherlimit zum aktiv gestalteten Werkzeug.