Grundlagen
Was sind Tokens und Kontextfenster bei KI?
Ein Token ist die kleinste Einheit, in die ein KI-Modell Text (und andere Daten) zerlegt – oft ein Wortteil, aber nicht identisch mit einem Wort. Das Kontextfenster ist die begrenzte Menge an Tokens, die ein Modell bei einer Anfrage gleichzeitig berücksichtigen kann; Eingabe und Ausgabe teilen sich dieses Budget je nach Anbieter. Wie viele Tokens ein Text ergibt, hängt vom jeweiligen Tokenizer ab – und ein großes Kontextfenster bedeutet nicht automatisch, dass ein Modell alle Informationen darin gleich zuverlässig nutzt.
Was ist ein Token?
Ein Token ist eine diskrete Einheit, die der jeweilige Tokenizer eines Modells verwendet. Bei Text kann ein Token ein kurzes ganzes Wort, einen Wortteil, einzelne Zeichen, Satzzeichen oder eine Zeichenkombination (oft samt vorangehendem Leerzeichen) repräsentieren. Welche Zerlegung entsteht, hängt vom Tokenizer, seinem Vokabular, der Modellfamilie, der Sprache und der konkreten Zeichenfolge ab.
Ein Token ist nicht dasselbe wie ein Wort. Ein Wort kann einem Token oder mehreren Tokens entsprechen; ein Token kann auch nur ein Satzzeichen, einen Wortbestandteil oder ein Leerzeichen mit Text abbilden. Die Gleichung „1 Token = 1 Wort“ ist falsch.
Verbreitet ist die Faustregel „ein Token ≈ vier Zeichen“ bzw. „100 Tokens ≈ 75 Wörter“. Das ist eine grobe, vor allem am Englischen orientierte Orientierung – keine feste Regel. Die tatsächliche Zahl hängt stark ab von Sprache, Wortlänge, Sonderzeichen, Code, Zahlen, Formatierung, URLs und Unicode. Für Kosten oder Limits nutzt man deshalb bei Bedarf den offiziellen Token-Zähler des konkreten Anbieters.
So funktioniert Tokenisierung
Vor der Verarbeitung wandelt ein Tokenizer den Text in Tokens um, die intern über numerische IDs aus einem festen Vokabular dargestellt werden: Text → Tokenizer → Token-IDs → Modell. Das Modell verarbeitet also nicht die sichtbare Zeichenkette, sondern numerische Repräsentationen (mehr dazu unter Embeddings).
Für die Zerlegung gibt es verschiedene Verfahren, etwa Byte-Pair Encoding (BPE), das häufige Zeichenpaare schrittweise zusammenfasst, oder das Unigram-Verfahren; SentencePiece ist ein sprachunabhängiges Werkzeug, das solche Verfahren umsetzt. Wichtig: Der Tokenizer ist eine Komponente – nicht „die KI“ selbst –, und verschiedene Modelle nutzen nicht denselben Tokenizer. Derselbe Text ergibt auf verschiedenen Modellen unterschiedlich viele Tokens.
Beispiel mit dem GPT-2/GPT-3-BPE-Tokenizer (r50k), geprüft am 09.08.2026:
„Künstliche Intelligenz verändert die Softwareentwicklung.“
Zerlegung (␣ = Leerzeichen als Token-Bestandteil):
K · ü · n · st · lic · he · ␣Int · ellig · enz · ␣ver · ä · nder · t · ␣die · ␣Software · ent · wick · l · ung · .
20 Tokens für 5 Wörter. Umlaute und das zusammengesetzte Wort „Softwareentwicklung“ erhöhen die Zahl. Ein anderer bzw. neuerer Tokenizer zerlegt denselben Satz anders – meist in weniger Tokens.
Für deutschsprachige Texte lässt sich englische Dokumentation nicht 1:1 übertragen: Zusammengesetzte Wörter, Umlaute und Sonderzeichen können die Tokenzahl erhöhen. Einen festen Prozentaufschlag „Deutsch braucht X % mehr Tokens“ gibt es ohne konkrete Messung aber nicht.
Welche Tokenarten gibt es?
| Begriff | Bedeutung | Für Nutzer sichtbar? | Kosten-/Kontextrelevant? |
|---|---|---|---|
| Input-Tokens | alles, was dem Modell für die Anfrage bereitgestellt wird | teils | ja / ja |
| Output-Tokens | die vom Modell erzeugte Antwort | ja | ja / ja |
| Reasoning-/Thinking-Tokens | zusätzliche Rechenschritte mancher Modelle | oft nein | je nach Anbieter / ja |
| Cached-Tokens | wiederverwendete Eingaben, die günstiger/schneller verarbeitet werden | nein | reduzierte Kosten / meist weiterhin Kontext |
| Tool-Tokens | Tool-Definitionen, Aufrufe und Ergebnisse | oft nein | ja / ja |
Der sichtbare Prompt ist nicht der gesamte Input. Je nach System zählen auch System-/Entwickleranweisungen, Gesprächsverlauf, Tool-Schemas, Retrieval-Ergebnisse, Dateien und interne Nachrichtenstruktur mit. Deshalb kann eine App mehr Tokens melden, als das bloße Zählen des eigenen Textes vermuten lässt.
Auch Bilder, PDFs, Audio oder Video werden je nach Anbieter in Token- bzw. Nutzungseinheiten umgerechnet – nach anbieterspezifischen Regeln, nicht nach „Zeichen ÷ 4“. Details unter multimodale KI; für konkrete Werte den Token-Zähler des Anbieters nutzen.
Was ist ein Kontextfenster?
Das Kontextfenster (Context Window) ist die begrenzte Menge tokenisierter Information, die einem Modell bei einer einzelnen Generierung zur Verfügung steht. Je nach Modell und API zählen dazu Systemanweisungen, Nutzereingabe, frühere Nachrichten, Dokumente und andere Modalitäten, Tool-Definitionen und -Ergebnisse – und der erzeugte Output selbst (inklusive etwaiger Reasoning-Tokens). Die genaue Berechnung ist anbieter- und modellspezifisch.
Kontextfenster ist nicht Gedächtnis
Als Analogie taugt ein begrenzter „Arbeitsbereich“ – technisch ist das Kontextfenster aber kein dauerhaftes Gedächtnis.
| Begriff | Was ist gemeint? |
|---|---|
| Kontextfenster | Information, die der aktuellen Inferenz zugänglich ist |
| Gesprächsverlauf | Nachrichten, die eine Anwendung erneut einspeist oder serverseitig verwaltet |
| Memory-Funktion | Produktfunktion, die Infos außerhalb des Fensters speichert und später wieder bereitstellt |
| Externe Datenbank / RAG | Wissen wird bei Bedarf abgerufen und dem Kontext hinzugefügt |
| Modellparameter | im Training gelerntes Wissen – nicht Teil des Gesprächskontexts |
Kontextfenster ≠ Gedächtnis. Das Fenster beschreibt den aktuell verfügbaren Arbeitskontext, nicht dauerhaft gespeichertes Wissen. Ein langer Chat „trainiert“ das Modell auch nicht.
Kontextfenster ist nicht Wissensstand
Ein großes Kontextfenster bedeutet nicht automatisch aktuelleres Wissen. Ein Modell kann sehr viel Kontext akzeptieren und trotzdem einen älteren Trainingsstichtag haben; umgekehrt kann ein Modell mit kleinerem Fenster über Websuche, RAG oder Tools aktuelle Informationen erhalten.
| Begriff | Beantwortet welche Frage? |
|---|---|
| Kontextfenster | Wie viel Information kann aktuell bereitgestellt werden? |
| Knowledge Cutoff | Bis wann reicht das im Training gelernte Wissen ungefähr? |
| Web / RAG / Tools | Welche externen, aktuellen Informationen kommen hinzu? |
| Memory | Was speichert das Produkt über mehrere Interaktionen? |
Kontextfenster ist nicht die Ausgabelänge
Ein sehr großes Kontextfenster heißt nicht, dass die Antwort beliebig lang sein darf: Viele Modelle haben eine deutlich kleinere maximale Ausgabelänge. Zu unterscheiden sind je nach Anbieter Context Window, maximaler Input, maximaler Output und teils gemeinsame Grenzen. Wenn Input und Output dasselbe Budget teilen, darf der Platz nicht vollständig mit Eingabe belegt werden, wenn noch eine lange Antwort folgen soll.
Schematisch: System + Prompt + Verlauf + Dateien + Tools + Reserve für die Ausgabe. Nur konzeptionell – die konkrete Berechnung ist modellspezifisch.
Was passiert, wenn das Fenster voll ist?
Die pauschale Aussage „dann gehen frühere Inhalte verloren“ stimmt so nicht – das Verhalten hängt vom System ab. Mögliche Strategien:
- Anfrage wird abgelehnt: eine API kann bei Überschreitung einen Fehler zurückgeben.
- Ausgabe wird begrenzt: zu wenig Restbudget kann die Antwort verkürzen.
- Ältere Nachrichten entfernen: manche Chatprodukte arbeiten mit rollierendem Kontext.
- Zusammenfassen / Compaction: ältere Teile werden verdichtet.
- Context Editing: wenig relevante Inhalte werden gezielt entfernt.
Ein scheinbar „unendlicher“ Chat bedeutet daher nicht, dass das Modell den gesamten Verlauf unverändert sieht – die Anwendung kann Nachrichten entfernen, zusammenfassen, erneut abrufen oder Memory nutzen. Produktverhalten und native Modellgrenze sind zu trennen.
Compaction, Context Management und Caching
Compaction verdichtet bei langen Abläufen ältere Konversationsteile, damit der relevante Zustand in weniger Tokens weiterläuft. Sie vergrößert aber nicht das native Kontextfenster und ist keine perfekte Langzeiterinnerung: Details können verloren gehen, Prioritäten falsch zusammengefasst werden, Fehler sich fortpflanzen.
Prompt- bzw. Context-Caching kann bei wiederholten, gleichen Eingaben Kosten und Latenz senken, indem wiederkehrende Präfixe effizienter verarbeitet werden. Aber:
Caching ist kein zusätzliches Gedächtnis. Es ist primär eine Effizienztechnik. Gecachte Inhalte belegen je nach Anbieter weiterhin Platz im Kontextfenster und ersetzen weder Kontextmanagement noch RAG oder Memory.
Großes Fenster ≠ zuverlässig nutzbarer Kontext
Dass ein Modell technisch sehr viele Tokens akzeptiert, beantwortet nur: Wie viel Input ist grundsätzlich möglich? Nicht: Wie zuverlässig nutzt das Modell jede Information darin? Deshalb unterscheidet man:
- Nominelles Kontextfenster: die dokumentierte technische Kapazität.
- Effektive Kontextnutzung: wie gut relevante Informationen tatsächlich gefunden, kombiniert, gewichtet und über lange Distanzen genutzt werden.
Die Forschung zeigt hier deutliche Grenzen: Bei „Lost in the Middle“ (Liu et al., 2023) nutzen Modelle Informationen am Anfang und Ende eines langen Kontexts oft zuverlässiger als in der Mitte. RULER (Hsieh et al., 2024) zeigt, dass das effektiv nutzbare Kontextfenster oft deutlich kürzer ist als die angegebene Länge und ein einfacher „Needle-in-a-Haystack“-Test (eine gezielt platzierte Information wiederfinden) reale Fähigkeiten wie Multi-Hop-Reasoning oder Aggregation nicht abdeckt. Eine Chroma-Analyse (2025) beschreibt unter dem Begriff „Context Rot“, dass die Zuverlässigkeit mit wachsender Eingabelänge abnehmen kann.
Maximales Kontextfenster ≠ zuverlässig nutzbarer Kontext. Und: mehr Kontext ist nicht automatisch besserer Kontext – irrelevante Inhalte erhöhen Kosten und Latenz, erschweren das Auffinden des Wesentlichen und können widersprüchliche Signale einbringen.
Praktisch geht es um Context Engineering: welche Information ein System zur richtigen Zeit erhält – Systemanweisung, Auftrag, Verlauf, Beispiele, RAG-Ergebnisse, Tools, Memory und Zusammenfassungen. Prompt Engineering ist nur ein Teil davon. Grundsatz: nicht möglichst viel, sondern möglichst relevanten Kontext bereitstellen.
Long Context oder RAG?
Große Kontextfenster machen RAG nicht überflüssig. Studien zeigen zwar, dass langer Kontext bei ausreichend Ressourcen die Genauigkeit erreichen oder übertreffen kann – RAG behält aber klare Vorteile bei Kosten, sehr großen Beständen, Aktualität und Quellenzuordnung.
| Strategie | Vorteil | Grenze |
|---|---|---|
| Alles in den Kontext | einfach, gesamter Bestand potenziell verfügbar | Tokenkosten, Latenz, Ablenkung, Long-Context-Qualität |
| RAG | nur relevante Ausschnitte, große/aktuelle Bestände, Quellen | Retrieval kann falsch/unvollständig sein, mehr Komplexität |
| Zusammenfassung | weniger Tokens | möglicher Informationsverlust |
| Compaction | gut für lange Chats/Agenten | Details können verloren gehen |
| Externe Tools / DB | gut für strukturierte, aktuelle Daten | Integrationsaufwand |
Für RAG werden große Dokumente in Abschnitte („Chunks“) zerlegt. Ein Chunk ist nicht dasselbe wie ein Token – ein Chunk ist eine größere, vom System definierte Einheit und kann viele Tokens enthalten.
Praxisbeispiele
Langes PDF (400 Seiten)
Vollständig in den Kontext nur, wenn Modell/API es tragen und die Aufgabe alles braucht; für einzelne Fragen ist RAG oft besser, sonst gezielt Kapitel extrahieren oder zusammenfassen.
Lange Chat-Sitzung
Alte, korrigierte und verworfene Anforderungen können mit neuen konkurrieren. Besser: aktueller Stand, klare aktuelle Regeln, relevante Dateien, strukturierte Zusammenfassung.
Coding-Projekt
Ein 1-Mio-Token-Fenster heißt nicht, das ganze Repository in jeden Request zu kopieren. Relevante Dateien, Fehlermeldungen und Abhängigkeiten gezielt auswählen.
KI-Agent
Tool-Ergebnisse, Suchtreffer und Zwischenstände füllen den Kontext schnell. Wichtig sind Tool-Result-Clearing, Compaction und externe Speicherung (KI-Agenten, MCP).
Kosten und Latenz
API-Anbieter bepreisen häufig Input, Output, gecachte Eingaben, Reasoning, Batch-Verarbeitung, langen Kontext und einzelne Modalitäten unterschiedlich. Feste Preise altern schnell und stehen deshalb nicht in diesem Grundlagenartikel – der KI-Kostenrechner rechnet Szenarien mit eigenen, aktuellen Werten. Bei vielen APIs werden Input- und Output-Tokens unterschiedlich berechnet; ob Output teurer ist, hängt vom Anbieter ab.
Große Eingaben beeinflussen auch die Latenz (Verarbeitung des Inputs, Zeit bis zum ersten Token, Generierungsgeschwindigkeit). Eine einfache Formel „doppelte Tokens = doppelte Wartezeit“ gibt es nicht – das hängt von Modell, Infrastruktur, Cache und Auslastung ab.
Datenschutz und Sicherheit
Ein großes Kontextfenster ist keine Einladung, alle Daten hochzuladen – Datenminimierung gilt auch hier. Vor umfangreichen Eingaben prüfen: Ist alles für die Aufgabe nötig? Enthält es personenbezogene oder vertrauliche Daten? Welcher Anbieter, welcher Tarif, welche Speicherfristen, welche Trainingseinstellungen? Ist lokale Verarbeitung möglich? Details unter Datenschutz und lokale KI.
Mehr Kontext heißt auch mehr Angriffsfläche: Umfangreiche Kontexte können fremde Webseiten, Dokumente, E-Mails oder Tool-Ergebnisse enthalten – mitsamt versteckter Anweisungen (Prompt Injection). Externe Inhalte sollten nicht unbesehen als Instruktionen behandelt werden.
Häufige Missverständnisse
| Missverständnis | Klarstellung |
|---|---|
| „Ein Token ist ein Wort.“ | Nein – Tokenisierung ist modellabhängig, ein Wort kann mehrere Tokens sein. |
| „Ein Token sind immer vier Zeichen.“ | Nur eine grobe, englischlastige Faustregel. |
| „100.000 Tokens sind genau X Seiten.“ | Hängt von Sprache, Format und Textdichte ab. |
| „Großes Kontextfenster = besseres Gedächtnis.“ | Nicht automatisch; das Fenster ist kein dauerhaftes Gedächtnis. |
| „Ein 1-Mio-Modell nutzt alle Tokens gleich zuverlässig.“ | Nein – effektive Nutzung ist oft geringer. |
| „Bei vollem Fenster löscht jede KI die älteste Nachricht.“ | Nein – das Verhalten hängt vom System ab. |
| „Prompt Caching vergrößert das Kontextfenster.“ | Nein – Caching spart Kosten/Latenz, keine Kapazität. |
| „Bei großen Fenstern ist RAG unnötig.“ | Nein – RAG bleibt bei Kosten, Aktualität und Quellen im Vorteil. |
| „Ein langer Chat trainiert das Modell.“ | Nein – Nutzung ist nicht Training. |
| „Das Kontextfenster bestimmt die Aktualität des Wissens.“ | Nein – das ist der Knowledge Cutoff bzw. externe Quellen. |
Kontext richtig nutzen: 7-Punkte-Check
- Braucht das Modell diese Information wirklich?
- Sind aktuelle Regeln klar von alten Inhalten getrennt?
- Lassen sich irrelevante Passagen entfernen?
- Wäre Retrieval/RAG geeigneter als „alles hineinkopieren“?
- Ist genügend Platz für die Antwort reserviert?
- Sind vertrauliche Daten wirklich notwendig?
- Lässt sich die zentrale Aussage anschließend überprüfen?
Weiterführend: Large Language Models, RAG, Embeddings, Halluzinationen, KI-Modelle und der Modell-Finder. Aktuelle Kontextgrößen konkreter Modelle stehen bei den Sprachmodellen, nicht in diesem Grundlagenartikel.
Quellen und weiterführende Informationen
- OpenAI: tiktoken – BPE-Tokenizer (Repository) (2026). Offizielles Repository · abgerufen am 09.08.2026
- OpenAI: „What are tokens and how to count them?“ (Hilfe). Anbieter-Dokumentation · abgerufen am 09.08.2026
- Anthropic: Context windows (Claude Docs) – Fenster umfasst Ein- und Ausgabe. Anbieter-Dokumentation · abgerufen am 09.08.2026
- OpenAI: Conversation state – Kontext = Input + Output + Reasoning. Anbieter-Dokumentation · abgerufen am 09.08.2026
- Google: Gemini API – Long context. Anbieter-Dokumentation · abgerufen am 09.08.2026
- Anthropic: Prompt caching – Effizienz, kein zusätzlicher Speicher. Anbieter-Dokumentation · abgerufen am 09.08.2026
- Anthropic: Context editing – Kontext gezielt kürzen (vergrößert das Fenster nicht). Anbieter-Dokumentation · abgerufen am 09.08.2026
- Google: Gemini API – Understand and count tokens (auch multimodal). Anbieter-Dokumentation · abgerufen am 09.08.2026
- Liu et al. (arXiv/TACL): „Lost in the Middle: How Language Models Use Long Contexts“ (2023). Wissenschaftliche Primärquelle · abgerufen am 09.08.2026
- Hsieh et al. (arXiv): „RULER: What's the Real Context Size of Your Long-Context Language Models?“ (2024). Wissenschaftliche Primärquelle · abgerufen am 09.08.2026
- Chroma (Hong, Troynikov, Huber): „Context Rot: How Increasing Input Tokens Impacts LLM Performance“ (Juli 2025). Technischer Report · abgerufen am 09.08.2026
- Li et al. (arXiv/EMNLP): „Retrieval Augmented Generation or Long-Context LLMs? A Comprehensive Study and Hybrid Approach“ (2024). Wissenschaftliche Primärquelle · abgerufen am 09.08.2026
- Sennrich et al. (arXiv/ACL): „Neural Machine Translation of Rare Words with Subword Units“ (BPE) (2016). Wissenschaftliche Primärquelle · abgerufen am 09.08.2026
- Kudo & Richardson (arXiv/EMNLP): „SentencePiece: A simple and language independent subword tokenizer“ (2018). Wissenschaftliche Primärquelle · abgerufen am 09.08.2026
Häufige Fragen
Was ist ein Token bei KI?
Die kleinste Einheit, in die ein Tokenizer Text (und andere Daten) zerlegt – oft ein Wortteil, manchmal ein ganzes Wort, ein Zeichen oder Satzzeichen.
Ist ein Token dasselbe wie ein Wort?
Nein. Ein Wort kann aus einem oder mehreren Tokens bestehen, und ein Token kann auch nur ein Wortteil oder Satzzeichen sein.
Wie viele Wörter sind 1.000 Tokens?
Nur grob schätzbar und stark sprach- und tokenizerabhängig. Für Englisch nennen Anbieter grob „100 Tokens ≈ 75 Wörter“; für Deutsch kann die Zahl abweichen.
Warum zählt derselbe Text bei verschiedenen Modellen unterschiedlich viele Tokens?
Weil Modelle unterschiedliche Tokenizer mit unterschiedlichem Vokabular verwenden. Dieselbe Zeichenfolge wird dadurch verschieden zerlegt.
Was ist ein Tokenizer?
Die Komponente, die Text in die vom Modell genutzten Tokens (bzw. Token-IDs) umwandelt. Der Tokenizer ist nicht das Modell selbst.
Was ist ein Kontextfenster?
Die begrenzte Menge an Tokens, die ein Modell bei einer Anfrage gleichzeitig berücksichtigen kann – je nach Anbieter inklusive Eingabe, Ausgabe und Reasoning.
Ist das Kontextfenster das Gedächtnis der KI?
Nein. Es ist der aktuell verfügbare Arbeitskontext, kein dauerhaftes Gedächtnis. Dauerhaftes Speichern übernehmen Memory-Funktionen oder externe Datenbanken.
Was ist der Unterschied zwischen Kontextfenster und Knowledge Cutoff?
Das Kontextfenster sagt, wie viel Information aktuell bereitgestellt werden kann. Der Knowledge Cutoff sagt, bis wann das im Training gelernte Wissen ungefähr reicht.
Gehört die Antwort zum Kontextfenster?
Bei vielen Modellen ja – Ausgabe und teils Reasoning-Tokens teilen sich das Budget mit dem Input. Deshalb sollte Platz für die Antwort reserviert werden.
Was passiert, wenn das Kontextfenster voll ist?
Das hängt vom System ab: Fehler, gekürzte Ausgabe, Entfernen älterer Nachrichten, Zusammenfassen oder Compaction. Es gibt kein einheitliches Verhalten.
Ist ein größeres Kontextfenster immer besser?
Nein. Mehr Kontext kann helfen, aber auch Kosten und Latenz erhöhen und relevante Informationen schwerer auffindbar machen. Relevanz schlägt Menge.
Verbrauchen Bilder ebenfalls Tokens?
Ja, je nach Anbieter werden Bilder, PDFs, Audio oder Video in Token- bzw. Nutzungseinheiten umgerechnet – nach anbieterspezifischen Regeln.
Spart Prompt Caching Kontext?
Nein. Caching senkt Kosten und Latenz für wiederkehrende Eingaben, schafft aber keine zusätzliche Kontextkapazität und kein Gedächtnis.
Wann ist RAG besser als ein großes Kontextfenster?
Bei sehr großen oder häufig aktualisierten Beständen, wenn nur wenige Passagen relevant sind oder Quellen gezielt ausgegeben werden sollen – oft auch aus Kostengründen.