Kontextfenster
Maximale Textmenge, die ein KI-Modell innerhalb einer Interaktion gleichzeitig verarbeiten und berücksichtigen kann.
Das Kontextfenster (Context Window) bezeichnet die maximale Textmenge, die ein Large Language Model innerhalb einer einzigen Interaktion verarbeiten kann.[1] Die Messung erfolgt in Tokens, wobei ein Token etwa 0,75 Wörtern entspricht. Im GEO-Kontext bestimmt das Kontextfenster, wie viele Quellen eine KI-Suchmaschine gleichzeitig erfasst und abgleicht, wodurch es direkt die Anzahl und Qualität der Citations beeinflusst.
Was ist ein Kontextfenster?
Das Kontextfenster fungiert als der Arbeitsspeicher eines LLMs. Es legt fest, wie viel Text ein Modell innerhalb einer einzigen Anfrage gleichzeitig erfasst und verarbeitet.[1] Die Messung des Kontextfensters erfolgt in Tokens. Ein Token entspricht etwa vier Zeichen oder 0,75 Wörtern. Das Wort „Hamburger“ wird beispielsweise in drei Tokens zerlegt: „Ham“, „bur“ und „ger“.
Das Kontextfenster umfasst sowohl die Eingabe eines Modells – also den Prompt und abgerufene Quellen – als auch die Ausgabe in Form der generierten Antwort. Bei GPT-4o stehen dafür maximal 128.000 Tokens für den Input und 16.384 Tokens für den Output zur Verfügung.[1] Alles, was das verfügbare Kontextfenster überschreitet, wird abgeschnitten oder muss in mehreren Schritten verarbeitet werden.
Für KI-Suchmaschinen ist das Kontextfenster ein zentraler limitierender Faktor. Stellt ein Nutzer eine Frage, durchsucht die KI das Web nach relevanten Quellen. Die gefundenen Inhalte werden in kleinere Abschnitte (Chunks) zerlegt und anschließend in das Kontextfenster geladen.[3] Ein größeres Kontextfenster ermöglicht es, mehr Quellen gleichzeitig zu erfassen und miteinander zu vergleichen.
Entscheidend ist die verfügbare Kontextgröße: Fasst ein Kontextfenster 128.000 Token und beansprucht jede Quelle durchschnittlich 3.000 Token, lassen sich rund 40 Quellen gleichzeitig verarbeiten. Bei 1 Million Token sind es mehr als 300. Je mehr Quellen berücksichtigt werden, desto größer ist das Potenzial für zusätzliche Citations und eine differenziertere Antwort.
Die Evolution des Kontextfensters
Vom Nadelöhr zum Megaspeicher[2][4]
Kontextfenster im GEO-Kontext
KI-Modelle nutzen Retrieval-Augmented Generation (RAG), um relevante Informationen gezielt auszuwählen. Statt eine gesamte Website in das Kontextfenster zu laden, zerlegen sie Inhalte in Chunks und rufen daraus nur die für die jeweilige Anfrage relevanten Abschnitte ab.[3] Das Kontextfenster bestimmt, wie viele dieser Chunks gleichzeitig verarbeitet werden können.
Für Webmaster bedeutet das: Ein größeres Kontextfenster ermöglicht die gleichzeitige Verarbeitung von mehr Quellen und damit potenziell mehr Citations pro Antwort. ChatGPT zitiert durchschnittlich fünf Domains pro Antwort, Google AI Overviews 7,7 und Perplexity 7,3.[5] Zwar könnte diese Zahl mit größeren Kontextfenstern weiter steigen, doch Context Rot begrenzt den Nutzen zusätzlicher Quellen: Bei sehr langen Eingaben verarbeiten Modelle Informationen zunehmend unzuverlässig.
Auch die Kosten spielen eine Rolle: Längere Kontexte erhöhen den Verarbeitungsaufwand. You.com zufolge senkte die gezieltere Auswahl relevanter Quellen den Token-Verbrauch pro Abfrage um ganze 61 Prozent.[6] Die meisten KI-Modelle setzen auf Effizienz, anstatt das Kontextfenster komplett auszuschöpfen.
Die KI verarbeitet nicht die gesamte Seite, sondern wählt die relevantesten Chunks aus. Inhalte sollten deshalb so strukturiert sein, dass jeder Abschnitt eigenständig verständlich ist und als Zitat dienen kann.
Das Phänomen Context Rot
Warum ein größeres Kontextfenster nicht automatisch zu besseren Antworten führt[3][7]
Die Konsequenz für GEO: KI-Modelle laden nicht beliebig viele Quellen in den Kontext, sondern priorisieren gezielt. Maßgeblich ist die inhaltliche Relevanz, nicht die vollständige Ausschöpfung des Kontextfensters. Inhalte müssen daher so aufgebaut sein, dass einzelne Abschnitte als eigenständige Informationseinheiten wirken und nicht in irrelevanten Daten untergehen.[3][6]
Inhalte für KI-Kontexte optimieren
Die folgenden fünf Tipps helfen dir dabei, Inhalte so zu strukturieren, dass relevante Abschnitte auch bei langen Kontexten als eigenständige, zitierfähige Chunks erkannt werden.[3][8].
Bezug zu anderen Begriffen
Das Kontextfenster ist eng mit anderen GEO-Konzepten verknüpft, da es bestimmt, welche Inhalte die KI gewichtet und in ihre Antworten einbindet.
Häufig gestellte Fragen
Was ist Context Rot?+
Context Rot beschreibt das Phänomen, dass die Leistung von Large Language Models bei steigender Token-Menge abnimmt. Eine Studie von Chroma Research untersuchte 18 Systeme – darunter GPT-4.1, Claude 4 und Gemini 2.5 – und kam zu dem Schluss, dass Modelle ihren verfügbaren Speicher nicht gleichmäßig nutzen. Selbst bei einfachen Aufgaben sinkt die Verlässlichkeit, weshalb ein größeres Kontextfenster keineswegs automatisch zu besseren Ergebnissen führt.
Was ist ein Kontextfenster?+
Das Kontextfenster bezeichnet die maximale Textmenge, die ein Large Language Model innerhalb einer einzigen Interaktion gleichzeitig verarbeiten kann. Es wird in Token gemessen, wobei ein Token im Durchschnitt etwa 0,75 Wörtern entspricht. GPT-4o verfügt über ein Kontextfenster von 128.000 Token, Claude 3.5 Sonnet über 200.000 und Gemini 1.5 Pro über eine Million.
Warum ist das Kontextfenster wichtig?+
Das Kontextfenster bestimmt, wie viele Quellen eine KI-Suchmaschine gleichzeitig verarbeiten und miteinander vergleichen kann. Ein größeres Kontextfenster ermöglicht potenziell mehr Citations pro Antwort. Allerdings nimmt die Leistung bei sehr langen Kontexten ab: Beim sogenannten Context Rot fällt es Modellen zunehmend schwer, relevante Informationen zuverlässig zu finden und richtig einzuordnen. Inhalte sollten daher so strukturiert sein, dass relevante Abschnitte auch für sich allein verständlich sind und als eigenständige Chunks funktionieren.
Wie unterscheiden sich die Kontextfenster der wichtigsten Modelle?+
GPT-4o bietet ein Kontextfenster von 128.000 Tokens, GPT-4.1 von einer Million. Claude 3.5 Sonnet erreicht 200.000 Tokens, Gemini 1.5 Pro und Gemini 2.5 Pro jeweils eine Million. Llama 4 Scout kommt sogar auf zehn Millionen Tokens. Ein größeres Kontextfenster führt jedoch nicht automatisch zu höherer Qualität: Das Phänomen Context Rot beweist eindrücklich, dass LLMs bei sehr langen Eingaben relevante Informationen zunehmend schlechter verarbeiten.
Wie muss ein Inhalt aufgebaut sein, damit die KI ihn als relevanten Chunk auswählt?+
Damit eine KI einen Inhalt als relevanten Chunk auswählt, muss er modular, präzise und kontextuell in sich geschlossen strukturiert sein. Jeder Abschnitt sollte exakt eine Kernfrage (Intent) beantworten, wobei das primäre Keyword und relevante Entitäten in den ersten Sätzen platziert werden müssen. Wichtig sind semantische Klarheit durch logische Überschriftenhierarchien, kurze prägnante Sätze sowie strukturierte Daten wie Tabellen oder Aufzählungen, da Retrieval-Modelle dichte Informationen und saubere semantische Grenzen bevorzugen.
Alle Quellen wurden im August 2026 abgerufen und auf inhaltliche Plausibilität geprüft.
Kontakt
Unverbindliche Erstberatung buchen