Das Wichtigste in Kürze
Das Context Window ist der Arbeitsspeicher einer KI-Anfrage. Es begrenzt, wie viel Text, Anleitung, Verlauf und Antwort gleichzeitig im Blick sind.
Rund eine Million Tokens sind heute Standard. Claude Opus 5 und Sonnet 5 verarbeiten 1 Mio. Tokens, GPT-6 Astra rund 1,05 Mio., Gemini 3.8 Flash 1.048.576 Tokens Eingabe (Anbieter-Dokumentationen, abgerufen am 14.09.2026).
Als Faustregel: Eine Million Tokens entsprechen laut Anthropic rund 555.000 Wörtern, laut Google etwa 50.000 Codezeilen oder acht durchschnittlichen Romanen. Für deutschen Fließtext rechnen Sie grob mit 700 bis 1.000 Tokens je A4-Seite.
Groß heißt nicht zuverlässig. Eine Untersuchung von Chroma an 18 Modellen (14. Juli 2025) zeigt: Modelle nutzen ihren Kontext nicht gleichmäßig, die Zuverlässigkeit sinkt mit wachsender Eingabelänge.
Lange Anfragen kosten Geld, auch wiederholt. Jede Rückfrage schickt den gesamten Kontext erneut. OpenAI berechnet oberhalb von 272.000 Eingabe-Tokens den doppelten Eingabepreis, Anthropic rechnet das volle Fenster zum Normaltarif ab. Zwischenspeicher senkt die Kosten auf einen Bruchteil.
Bis vor Kurzem war das Context Window das wichtigste Unterscheidungsmerkmal zwischen KI-Modellen: Wer ein 150-Seiten-Dokument analysieren wollte, musste genau hinsehen, welches Modell das am Stück schafft. Dieser Engpass ist weg. Stand September 2026 verarbeiten die Spitzenmodelle aller großen Anbieter rund eine Million Tokens, also mehrere hundert Seiten in einer Anfrage.
Damit verschiebt sich die Frage. Entscheidend ist nicht mehr, wie groß das Fenster ist, sondern wie zuverlässig ein Modell diesen Platz nutzt, was lange Anfragen kosten und wann eine gezielte Suche im eigenen Wissensbestand die bessere Lösung ist. Dieser Artikel erklärt beides: die Grundlagen und die Entscheidung dahinter.
Was ist ein Context Window?
Das Context Window, auf Deutsch Kontextfenster, ist die maximale Menge an Tokens, die ein Sprachmodell für eine Anfrage gleichzeitig verarbeiten kann. Dazu gehören alle Bestandteile der Anfrage: die Systemanweisung, hochgeladene Dokumente, der bisherige Gesprächsverlauf, die aktuelle Frage und die Antwort des Modells.
Ein Token ist die kleinste Verarbeitungseinheit, meist ein Wortteil. Deutsche Texte brauchen mehr Tokens je Wort als englische, weil Komposita und Umlaute häufiger zerlegt werden.
Wichtig für jeden Vergleich: Die Zerlegung ist je Anbieter unterschiedlich. Anthropic weist in der Preisdokumentation ausdrücklich aus, dass Modelle ab Claude Opus 4.7 einen neuen Tokenizer nutzen, der für denselben Text rund 30 % mehr Tokens erzeugt. Tokenzahlen und Tokenpreise verschiedener Anbieter sind deshalb nur eingeschränkt vergleichbar.
Wird das Fenster überschritten, passiert eines von zwei Dingen: Die Anfrage wird abgelehnt, oder ältere Teile des Verlaufs fallen heraus. Im Chat merken Sie das daran, dass sich das Modell an frühere Absprachen nicht mehr erinnert.
Wie viele Tokens hat mein Dokument?
Für die Planung reicht eine Faustregel: Rechnen Sie für deutschen Fließtext mit 700 bis 1.000 Tokens je A4-Seite. Eine Million Tokens sind damit grob 1.000 Seiten, und ein typischer 40-seitiger Vertrag liegt bei 30.000 bis 40.000 Tokens.
Die Anbieter geben dazu eigene Vergleichswerte an. Anthropic beziffert eine Million Tokens auf rund 555.000 Wörter beim aktuellen Tokenizer. Google nennt für dieselbe Menge etwa 50.000 Codezeilen, acht durchschnittliche englische Romane oder die Abschriften von mehr als 200 Podcast-Folgen (Google, Long Context). Solche Vergleichswerte orientieren sich an englischen Texten; weil deutscher Text in mehr Tokens je Wort zerfällt, passen in dieselbe Menge weniger deutsche Wörter.
| Unterlage | Umfang | Geschätzte Tokens | Passt in ein Fenster von 1 Mio. Tokens? |
|---|---|---|---|
| Angebot oder Bericht | 10 Seiten | rund 8.000 | Ja, mit großem Abstand |
| Rahmenvertrag | 50 Seiten | rund 40.000 | Ja |
| Technisches Handbuch | 200 Seiten | rund 170.000 | Ja |
| Unterlagen einer Ausschreibung | 20 Dokumente, 400 Seiten | rund 340.000 | Ja, aber bei OpenAI im teureren Tarif |
| Produktkatalog oder Wissensbestand | 5.000 Seiten | mehrere Millionen | Nein, hier führt nur gezielte Suche zum Ziel |
Die Zahlen sind Schätzungen für die Planung, keine Messwerte. Wenn es genau werden muss, zählen Sie die Tokens mit dem Werkzeug Ihres Anbieters, bevor Sie eine Verarbeitung im großen Stil starten.
Wie groß sind die Kontextfenster im September 2026?
Bei den Spitzenmodellen ist eine Million Tokens die Norm, bei kleinen und offenen Modellen liegt die Spanne weiter auseinander.
- Spitzen- und Arbeitspferd-Modelle der großen Anbieter: rund 1 Mio. Tokens. Claude Opus 5, Claude Sonnet 5 und Claude Fable 5.1 nennen 1 Mio. Tokens Kontext und 128.000 Tokens Ausgabe, GPT-6 Astra und die GPT-5.6-Familie 1,05 Mio. Tokens, Gemini 3.8 Flash 1.048.576 Tokens Eingabe und 65.536 Tokens Ausgabe.
- Günstige Stufen: teilweise kleiner, etwa Claude Haiku 4.5 mit 200.000 Tokens.
- Offene Modelle: je nach Modell sehr unterschiedlich, deshalb immer die Modellkarte prüfen. DeepSeek gibt für seine aktuellen Modelle 1 Mio. Tokens an.
Achten Sie auf die zweite Zahl: Die Ausgabelänge ist deutlich kleiner als das Fenster. Ein Modell kann 300 Seiten lesen, aber keine 300 Seiten am Stück schreiben. Für lange Ergebnisdokumente brauchen Sie deshalb mehrere Schritte, unabhängig von der Fenstergröße. Welche Modelle aktuell welche Werte haben und was sie kosten, steht im LLM-Vergleich 2026.
Warum ein großes Fenster nicht automatisch bessere Antworten bringt
Weil Modelle ihren Kontext nicht gleichmäßig nutzen. Das Forschungsteam von Chroma hat 18 Modelle mit wachsenden Eingabelängen getestet und beschreibt das Ergebnis so: Die Leistung wird zunehmend unzuverlässig, je länger die Eingabe wird, und zwar auch bei einfachen Aufgaben (Chroma, 14. Juli 2025). Der Effekt hat den Namen „Context Rot" bekommen.
Google beschreibt eine verwandte Grenze in der eigenen Dokumentation: Das Modell findet eine einzelne Information zuverlässig, aber wenn mehrere Angaben gleichzeitig gesucht werden, sinkt die Genauigkeit.
Für die Praxis heißt das:
- Weniger ist oft besser. Zehn relevante Seiten schlagen 300 Seiten Kontext, in denen die Antwort irgendwo steht.
- Struktur hilft. Eine klare Frage, ein klar abgegrenztes Dokument und eine Aufgabe pro Anfrage liefern stabilere Ergebnisse als ein Sammelprompt.
- Prüfen statt vertrauen. Bei langen Eingaben gehören Stichproben dazu, besonders wenn das Ergebnis in eine Entscheidung einfließt. Wie Sie das systematisch tun, steht im Leitfaden zu KI-Halluzinationen.
Was kosten lange Anfragen?
Sie zahlen für die tatsächlich genutzten Tokens, nicht für die Fenstergröße. Teuer werden lange Anfragen trotzdem, und zwar aus drei Gründen.
Erstens wird der Kontext bei jeder Rückfrage erneut verarbeitet. Ein Handbuch mit 200 Seiten entspricht rund 170.000 Tokens. Bei einem Arbeitspferd-Modell mit 2 $ je Million Eingabe-Tokens kostet die erste Anfrage etwa 0,34 $. Zehn Rückfragen im selben Gespräch kosten das Zehnfache, weil das Handbuch jedes Mal mitgeschickt wird.
Zweitens berechnen manche Anbieter oberhalb einer Schwelle mehr. OpenAI weist für die aktuellen Modelle aus, dass Anfragen mit mehr als 272.000 Eingabe-Tokens mit dem doppelten Eingabe- und dem 1,5-fachen Ausgabepreis für die gesamte Anfrage abgerechnet werden. Anthropic geht den umgekehrten Weg und rechnet das volle Fenster zum Normaltarif ab: Eine Anfrage mit 900.000 Tokens hat denselben Tokenpreis wie eine mit 9.000.
Drittens zählt das Nachdenken mit. Bei den aktuellen Modellen werden die internen Denkschritte als Ausgabe abgerechnet, und Ausgabe ist die teure Seite. Mehr dazu im Leitfaden zu Reasoning-Modellen.
Der wirksamste Hebel dagegen ist der Zwischenspeicher: Ein Cache-Treffer kostet bei Anthropic 10 % des Eingabepreises, bei OpenAI ein Zehntel. Wer dasselbe Dokument oder dieselbe Anleitung mehrfach verwendet, zahlt den vollen Preis damit im Wesentlichen nur beim ersten Mal. Wie Sie solche Effekte im Budget sichtbar machen, steht im Leitfaden zu Token-Kosten und FinOps für KI.
Wann ist gezielte Suche besser als ein langer Prompt?
Sobald der Bestand größer ist als ein Vorgang oder sich ständig ändert. Ein großes Kontextfenster ist gut für einen abgeschlossenen Fall: ein Vertrag, eine Ausschreibung, ein Projektordner. Für Wissen, das im Unternehmen dauerhaft vorliegt, ist gezielte Suche der bessere Weg.
Dabei sucht das System zuerst die passenden Abschnitte heraus und gibt nur diese an das Modell weiter. Das Verfahren heißt Retrieval Augmented Generation und ist im Leitfaden zu RAG ausführlich erklärt. Drei Vorteile sind entscheidend:
- Genauer: Weniger irrelevanter Text bedeutet weniger Gelegenheit, sich zu verlaufen.
- Günstiger: Statt 300 Seiten gehen 5 Seiten in die Anfrage.
- Aktueller: Neue Dokumente stehen sofort zur Verfügung, ohne dass jemand einen Prompt pflegt.
Als Faustregel: Ein einzelner Vorgang gehört in den Kontext, ein Bestand in einen Wissensspeicher. Bei gescannten Unterlagen kommt die Texterkennung davor; wie ein solcher Ablauf im Unternehmen aussieht, beschreibt der Leitfaden zur intelligenten Dokumentenverarbeitung.
Wie Plotdesk große Dokumentbestände nutzbar macht
Plotdesk verbindet eine KI-Plattform mit einem Umsetzungsteam für den Mittelstand. Für die Kontextfrage heißt das: Einzelne Vorgänge laden Ihre Mitarbeitenden direkt in den Chat, inklusive Texterkennung für gescannte Unterlagen. Dauerhaftes Wissen legen Sie in Silos ab, also in Wissensspeichern, aus denen die KI gezielt die passenden Passagen holt, statt jedes Mal alles zu laden.
Welche Modelle mit welchem Kontextfenster einem Team oder einer Anwendung zur Verfügung stehen, geben Sie zentral frei. Im Model Garden stehen dafür mehr als 100 Modellvarianten aus zehn Provider-Typen bereit, und Nutzungs- und Kostenanalysen zeigen je Bereich, wo lange Anfragen entstehen. Die Dokumente bleiben in einer dedizierten Instanz in der EU oder im eigenen Tenant, abgesichert über einen DSGVO-konformen AVV und nachvollziehbar in Audit-Logs.
Häufige Fragen zum Context Window
Wie viele Seiten passen in 1 Million Tokens?
Zahle ich für ein großes Kontextfenster mehr?
Reicht ein großes Kontextfenster statt einer Wissensdatenbank?
Warum übersieht die KI Details in langen Dokumenten?
Wie lang darf die Antwort sein?
Fazit: Die Fenstergröße ist kein Auswahlkriterium mehr
Ein Kontextfenster von einer Million Tokens ist 2026 Standard, kein Vorteil einzelner Anbieter. Damit verliert die Frage „Welches Modell hat das größte Fenster?" ihre Bedeutung, und drei andere Fragen rücken nach vorn: Wie zuverlässig nutzt das Modell den Platz, was kostet eine lange Anfrage in der Wiederholung, und gehört dieser Inhalt überhaupt in den Prompt oder in einen Wissensspeicher?
Wer diese drei Fragen je Anwendungsfall beantwortet, bekommt bessere Ergebnisse zu niedrigeren Kosten als mit jedem Modellwechsel.