Grundlagen

Was sind Tokens und Kontextfenster bei KI?

Ein Token ist die kleinste Einheit, in die ein KI-Modell Text (und andere Daten) zerlegt – oft ein Wortteil, aber nicht identisch mit einem Wort. Das Kontextfenster ist die begrenzte Menge an Tokens, die ein Modell bei einer Anfrage gleichzeitig berücksichtigen kann; Eingabe und Ausgabe teilen sich dieses Budget je nach Anbieter. Wie viele Tokens ein Text ergibt, hängt vom jeweiligen Tokenizer ab – und ein großes Kontextfenster bedeutet nicht automatisch, dass ein Modell alle Informationen darin gleich zuverlässig nutzt.

Was ist ein Token?

Ein Token ist eine diskrete Einheit, die der jeweilige Tokenizer eines Modells verwendet. Bei Text kann ein Token ein kurzes ganzes Wort, einen Wortteil, einzelne Zeichen, Satzzeichen oder eine Zeichenkombination (oft samt vorangehendem Leerzeichen) repräsentieren. Welche Zerlegung entsteht, hängt vom Tokenizer, seinem Vokabular, der Modellfamilie, der Sprache und der konkreten Zeichenfolge ab.

Merksatz 1

Ein Token ist nicht dasselbe wie ein Wort. Ein Wort kann einem Token oder mehreren Tokens entsprechen; ein Token kann auch nur ein Satzzeichen, einen Wortbestandteil oder ein Leerzeichen mit Text abbilden. Die Gleichung „1 Token = 1 Wort“ ist falsch.

Verbreitet ist die Faustregel „ein Token ≈ vier Zeichen“ bzw. „100 Tokens ≈ 75 Wörter“. Das ist eine grobe, vor allem am Englischen orientierte Orientierung – keine feste Regel. Die tatsächliche Zahl hängt stark ab von Sprache, Wortlänge, Sonderzeichen, Code, Zahlen, Formatierung, URLs und Unicode. Für Kosten oder Limits nutzt man deshalb bei Bedarf den offiziellen Token-Zähler des konkreten Anbieters.

So funktioniert Tokenisierung

Vor der Verarbeitung wandelt ein Tokenizer den Text in Tokens um, die intern über numerische IDs aus einem festen Vokabular dargestellt werden: Text → Tokenizer → Token-IDs → Modell. Das Modell verarbeitet also nicht die sichtbare Zeichenkette, sondern numerische Repräsentationen (mehr dazu unter Embeddings).

Von Text zu Token Text geht in den Tokenizer, dieser erzeugt Tokens beziehungsweise Token-IDs, die das Modell verarbeitet. Die konkrete Zerlegung hängt vom Tokenizer ab. Text Tokenizer Tokens / IDs Modell
Die konkrete Zerlegung hängt vom Modell bzw. Tokenizer ab.

Für die Zerlegung gibt es verschiedene Verfahren, etwa Byte-Pair Encoding (BPE), das häufige Zeichenpaare schrittweise zusammenfasst, oder das Unigram-Verfahren; SentencePiece ist ein sprachunabhängiges Werkzeug, das solche Verfahren umsetzt. Wichtig: Der Tokenizer ist eine Komponente – nicht „die KI“ selbst –, und verschiedene Modelle nutzen nicht denselben Tokenizer. Derselbe Text ergibt auf verschiedenen Modellen unterschiedlich viele Tokens.

Echtes Tokenisierungsbeispiel

Beispiel mit dem GPT-2/GPT-3-BPE-Tokenizer (r50k), geprüft am 09.08.2026:

„Künstliche Intelligenz verändert die Softwareentwicklung.“

Zerlegung (␣ = Leerzeichen als Token-Bestandteil):
K · ü · n · st · lic · he · ␣Int · ellig · enz · ␣ver · ä · nder · t · ␣die · ␣Software · ent · wick · l · ung · .

20 Tokens für 5 Wörter. Umlaute und das zusammengesetzte Wort „Softwareentwicklung“ erhöhen die Zahl. Ein anderer bzw. neuerer Tokenizer zerlegt denselben Satz anders – meist in weniger Tokens.

Für deutschsprachige Texte lässt sich englische Dokumentation nicht 1:1 übertragen: Zusammengesetzte Wörter, Umlaute und Sonderzeichen können die Tokenzahl erhöhen. Einen festen Prozentaufschlag „Deutsch braucht X % mehr Tokens“ gibt es ohne konkrete Messung aber nicht.

Welche Tokenarten gibt es?

Tokenarten im Überblick
BegriffBedeutungFür Nutzer sichtbar?Kosten-/Kontextrelevant?
Input-Tokensalles, was dem Modell für die Anfrage bereitgestellt wirdteilsja / ja
Output-Tokensdie vom Modell erzeugte Antwortjaja / ja
Reasoning-/Thinking-Tokenszusätzliche Rechenschritte mancher Modelleoft neinje nach Anbieter / ja
Cached-Tokenswiederverwendete Eingaben, die günstiger/schneller verarbeitet werdenneinreduzierte Kosten / meist weiterhin Kontext
Tool-TokensTool-Definitionen, Aufrufe und Ergebnisseoft neinja / ja
Wichtig

Der sichtbare Prompt ist nicht der gesamte Input. Je nach System zählen auch System-/Entwickleranweisungen, Gesprächsverlauf, Tool-Schemas, Retrieval-Ergebnisse, Dateien und interne Nachrichtenstruktur mit. Deshalb kann eine App mehr Tokens melden, als das bloße Zählen des eigenen Textes vermuten lässt.

Auch Bilder, PDFs, Audio oder Video werden je nach Anbieter in Token- bzw. Nutzungseinheiten umgerechnet – nach anbieterspezifischen Regeln, nicht nach „Zeichen ÷ 4“. Details unter multimodale KI; für konkrete Werte den Token-Zähler des Anbieters nutzen.

Was ist ein Kontextfenster?

Das Kontextfenster (Context Window) ist die begrenzte Menge tokenisierter Information, die einem Modell bei einer einzelnen Generierung zur Verfügung steht. Je nach Modell und API zählen dazu Systemanweisungen, Nutzereingabe, frühere Nachrichten, Dokumente und andere Modalitäten, Tool-Definitionen und -Ergebnisse – und der erzeugte Output selbst (inklusive etwaiger Reasoning-Tokens). Die genaue Berechnung ist anbieter- und modellspezifisch.

Was füllt das Kontextfenster? Das Token-Budget des Kontextfensters wird geteilt zwischen Systemanweisung, Gesprächsverlauf, aktuellem Prompt, Dateien und Retrieval, Tools und Tool-Ergebnissen sowie einer Reserve für die Ausgabe. Die konkrete Abrechnung unterscheidet sich je Modell und API. Kontextfenster (Token-Budget) Systemanweisung Gesprächsverlauf Aktueller Prompt Dateien / Retrieval Tools / Tool-Ergebnisse Reserve für die Ausgabe
Schematische Darstellung. Die konkrete Tokenabrechnung unterscheidet sich je Modell und API.

Kontextfenster ist nicht Gedächtnis

Als Analogie taugt ein begrenzter „Arbeitsbereich“ – technisch ist das Kontextfenster aber kein dauerhaftes Gedächtnis.

Kontext ist nicht dauerhaft gespeichertes Wissen
BegriffWas ist gemeint?
KontextfensterInformation, die der aktuellen Inferenz zugänglich ist
GesprächsverlaufNachrichten, die eine Anwendung erneut einspeist oder serverseitig verwaltet
Memory-FunktionProduktfunktion, die Infos außerhalb des Fensters speichert und später wieder bereitstellt
Externe Datenbank / RAGWissen wird bei Bedarf abgerufen und dem Kontext hinzugefügt
Modellparameterim Training gelerntes Wissen – nicht Teil des Gesprächskontexts
Merksatz 2

Kontextfenster ≠ Gedächtnis. Das Fenster beschreibt den aktuell verfügbaren Arbeitskontext, nicht dauerhaft gespeichertes Wissen. Ein langer Chat „trainiert“ das Modell auch nicht.

Kontextfenster ist nicht Wissensstand

Ein großes Kontextfenster bedeutet nicht automatisch aktuelleres Wissen. Ein Modell kann sehr viel Kontext akzeptieren und trotzdem einen älteren Trainingsstichtag haben; umgekehrt kann ein Modell mit kleinerem Fenster über Websuche, RAG oder Tools aktuelle Informationen erhalten.

Vier verschiedene Fragen
BegriffBeantwortet welche Frage?
KontextfensterWie viel Information kann aktuell bereitgestellt werden?
Knowledge CutoffBis wann reicht das im Training gelernte Wissen ungefähr?
Web / RAG / ToolsWelche externen, aktuellen Informationen kommen hinzu?
MemoryWas speichert das Produkt über mehrere Interaktionen?

Kontextfenster ist nicht die Ausgabelänge

Ein sehr großes Kontextfenster heißt nicht, dass die Antwort beliebig lang sein darf: Viele Modelle haben eine deutlich kleinere maximale Ausgabelänge. Zu unterscheiden sind je nach Anbieter Context Window, maximaler Input, maximaler Output und teils gemeinsame Grenzen. Wenn Input und Output dasselbe Budget teilen, darf der Platz nicht vollständig mit Eingabe belegt werden, wenn noch eine lange Antwort folgen soll.

Ausgabe-Budget reservieren

Schematisch: System + Prompt + Verlauf + Dateien + Tools + Reserve für die Ausgabe. Nur konzeptionell – die konkrete Berechnung ist modellspezifisch.

Was passiert, wenn das Fenster voll ist?

Die pauschale Aussage „dann gehen frühere Inhalte verloren“ stimmt so nicht – das Verhalten hängt vom System ab. Mögliche Strategien:

  • Anfrage wird abgelehnt: eine API kann bei Überschreitung einen Fehler zurückgeben.
  • Ausgabe wird begrenzt: zu wenig Restbudget kann die Antwort verkürzen.
  • Ältere Nachrichten entfernen: manche Chatprodukte arbeiten mit rollierendem Kontext.
  • Zusammenfassen / Compaction: ältere Teile werden verdichtet.
  • Context Editing: wenig relevante Inhalte werden gezielt entfernt.

Ein scheinbar „unendlicher“ Chat bedeutet daher nicht, dass das Modell den gesamten Verlauf unverändert sieht – die Anwendung kann Nachrichten entfernen, zusammenfassen, erneut abrufen oder Memory nutzen. Produktverhalten und native Modellgrenze sind zu trennen.

Compaction, Context Management und Caching

Compaction verdichtet bei langen Abläufen ältere Konversationsteile, damit der relevante Zustand in weniger Tokens weiterläuft. Sie vergrößert aber nicht das native Kontextfenster und ist keine perfekte Langzeiterinnerung: Details können verloren gehen, Prioritäten falsch zusammengefasst werden, Fehler sich fortpflanzen.

Prompt- bzw. Context-Caching kann bei wiederholten, gleichen Eingaben Kosten und Latenz senken, indem wiederkehrende Präfixe effizienter verarbeitet werden. Aber:

Merksatz 5

Caching ist kein zusätzliches Gedächtnis. Es ist primär eine Effizienztechnik. Gecachte Inhalte belegen je nach Anbieter weiterhin Platz im Kontextfenster und ersetzen weder Kontextmanagement noch RAG oder Memory.

Großes Fenster ≠ zuverlässig nutzbarer Kontext

Dass ein Modell technisch sehr viele Tokens akzeptiert, beantwortet nur: Wie viel Input ist grundsätzlich möglich? Nicht: Wie zuverlässig nutzt das Modell jede Information darin? Deshalb unterscheidet man:

  • Nominelles Kontextfenster: die dokumentierte technische Kapazität.
  • Effektive Kontextnutzung: wie gut relevante Informationen tatsächlich gefunden, kombiniert, gewichtet und über lange Distanzen genutzt werden.

Die Forschung zeigt hier deutliche Grenzen: Bei „Lost in the Middle“ (Liu et al., 2023) nutzen Modelle Informationen am Anfang und Ende eines langen Kontexts oft zuverlässiger als in der Mitte. RULER (Hsieh et al., 2024) zeigt, dass das effektiv nutzbare Kontextfenster oft deutlich kürzer ist als die angegebene Länge und ein einfacher „Needle-in-a-Haystack“-Test (eine gezielt platzierte Information wiederfinden) reale Fähigkeiten wie Multi-Hop-Reasoning oder Aggregation nicht abdeckt. Eine Chroma-Analyse (2025) beschreibt unter dem Begriff „Context Rot“, dass die Zuverlässigkeit mit wachsender Eingabelänge abnehmen kann.

Merksätze 3 & 4

Maximales Kontextfenster ≠ zuverlässig nutzbarer Kontext. Und: mehr Kontext ist nicht automatisch besserer Kontext – irrelevante Inhalte erhöhen Kosten und Latenz, erschweren das Auffinden des Wesentlichen und können widersprüchliche Signale einbringen.

Praktisch geht es um Context Engineering: welche Information ein System zur richtigen Zeit erhält – Systemanweisung, Auftrag, Verlauf, Beispiele, RAG-Ergebnisse, Tools, Memory und Zusammenfassungen. Prompt Engineering ist nur ein Teil davon. Grundsatz: nicht möglichst viel, sondern möglichst relevanten Kontext bereitstellen.

Long Context oder RAG?

Große Kontextfenster machen RAG nicht überflüssig. Studien zeigen zwar, dass langer Kontext bei ausreichend Ressourcen die Genauigkeit erreichen oder übertreffen kann – RAG behält aber klare Vorteile bei Kosten, sehr großen Beständen, Aktualität und Quellenzuordnung.

Kontextstrategien im Vergleich
StrategieVorteilGrenze
Alles in den Kontexteinfach, gesamter Bestand potenziell verfügbarTokenkosten, Latenz, Ablenkung, Long-Context-Qualität
RAGnur relevante Ausschnitte, große/aktuelle Bestände, QuellenRetrieval kann falsch/unvollständig sein, mehr Komplexität
Zusammenfassungweniger Tokensmöglicher Informationsverlust
Compactiongut für lange Chats/AgentenDetails können verloren gehen
Externe Tools / DBgut für strukturierte, aktuelle DatenIntegrationsaufwand

Für RAG werden große Dokumente in Abschnitte („Chunks“) zerlegt. Ein Chunk ist nicht dasselbe wie ein Token – ein Chunk ist eine größere, vom System definierte Einheit und kann viele Tokens enthalten.

Praxisbeispiele

Beispiel

Langes PDF (400 Seiten)

Vollständig in den Kontext nur, wenn Modell/API es tragen und die Aufgabe alles braucht; für einzelne Fragen ist RAG oft besser, sonst gezielt Kapitel extrahieren oder zusammenfassen.

Beispiel

Lange Chat-Sitzung

Alte, korrigierte und verworfene Anforderungen können mit neuen konkurrieren. Besser: aktueller Stand, klare aktuelle Regeln, relevante Dateien, strukturierte Zusammenfassung.

Beispiel

Coding-Projekt

Ein 1-Mio-Token-Fenster heißt nicht, das ganze Repository in jeden Request zu kopieren. Relevante Dateien, Fehlermeldungen und Abhängigkeiten gezielt auswählen.

Beispiel

KI-Agent

Tool-Ergebnisse, Suchtreffer und Zwischenstände füllen den Kontext schnell. Wichtig sind Tool-Result-Clearing, Compaction und externe Speicherung (KI-Agenten, MCP).

Kosten und Latenz

API-Anbieter bepreisen häufig Input, Output, gecachte Eingaben, Reasoning, Batch-Verarbeitung, langen Kontext und einzelne Modalitäten unterschiedlich. Feste Preise altern schnell und stehen deshalb nicht in diesem Grundlagenartikel – der KI-Kostenrechner rechnet Szenarien mit eigenen, aktuellen Werten. Bei vielen APIs werden Input- und Output-Tokens unterschiedlich berechnet; ob Output teurer ist, hängt vom Anbieter ab.

Große Eingaben beeinflussen auch die Latenz (Verarbeitung des Inputs, Zeit bis zum ersten Token, Generierungsgeschwindigkeit). Eine einfache Formel „doppelte Tokens = doppelte Wartezeit“ gibt es nicht – das hängt von Modell, Infrastruktur, Cache und Auslastung ab.

Datenschutz und Sicherheit

Ein großes Kontextfenster ist keine Einladung, alle Daten hochzuladen – Datenminimierung gilt auch hier. Vor umfangreichen Eingaben prüfen: Ist alles für die Aufgabe nötig? Enthält es personenbezogene oder vertrauliche Daten? Welcher Anbieter, welcher Tarif, welche Speicherfristen, welche Trainingseinstellungen? Ist lokale Verarbeitung möglich? Details unter Datenschutz und lokale KI.

Mehr Kontext heißt auch mehr Angriffsfläche: Umfangreiche Kontexte können fremde Webseiten, Dokumente, E-Mails oder Tool-Ergebnisse enthalten – mitsamt versteckter Anweisungen (Prompt Injection). Externe Inhalte sollten nicht unbesehen als Instruktionen behandelt werden.

Häufige Missverständnisse

Mythen über Tokens und Kontextfenster
MissverständnisKlarstellung
„Ein Token ist ein Wort.“Nein – Tokenisierung ist modellabhängig, ein Wort kann mehrere Tokens sein.
„Ein Token sind immer vier Zeichen.“Nur eine grobe, englischlastige Faustregel.
„100.000 Tokens sind genau X Seiten.“Hängt von Sprache, Format und Textdichte ab.
„Großes Kontextfenster = besseres Gedächtnis.“Nicht automatisch; das Fenster ist kein dauerhaftes Gedächtnis.
„Ein 1-Mio-Modell nutzt alle Tokens gleich zuverlässig.“Nein – effektive Nutzung ist oft geringer.
„Bei vollem Fenster löscht jede KI die älteste Nachricht.“Nein – das Verhalten hängt vom System ab.
„Prompt Caching vergrößert das Kontextfenster.“Nein – Caching spart Kosten/Latenz, keine Kapazität.
„Bei großen Fenstern ist RAG unnötig.“Nein – RAG bleibt bei Kosten, Aktualität und Quellen im Vorteil.
„Ein langer Chat trainiert das Modell.“Nein – Nutzung ist nicht Training.
„Das Kontextfenster bestimmt die Aktualität des Wissens.“Nein – das ist der Knowledge Cutoff bzw. externe Quellen.

Kontext richtig nutzen: 7-Punkte-Check

  • Braucht das Modell diese Information wirklich?
  • Sind aktuelle Regeln klar von alten Inhalten getrennt?
  • Lassen sich irrelevante Passagen entfernen?
  • Wäre Retrieval/RAG geeigneter als „alles hineinkopieren“?
  • Ist genügend Platz für die Antwort reserviert?
  • Sind vertrauliche Daten wirklich notwendig?
  • Lässt sich die zentrale Aussage anschließend überprüfen?

Weiterführend: Large Language Models, RAG, Embeddings, Halluzinationen, KI-Modelle und der Modell-Finder. Aktuelle Kontextgrößen konkreter Modelle stehen bei den Sprachmodellen, nicht in diesem Grundlagenartikel.

Quellen und weiterführende Informationen

  1. OpenAI: tiktoken – BPE-Tokenizer (Repository) (2026). Offizielles Repository · abgerufen am 09.08.2026
  2. OpenAI: „What are tokens and how to count them?“ (Hilfe). Anbieter-Dokumentation · abgerufen am 09.08.2026
  3. Anthropic: Context windows (Claude Docs) – Fenster umfasst Ein- und Ausgabe. Anbieter-Dokumentation · abgerufen am 09.08.2026
  4. OpenAI: Conversation state – Kontext = Input + Output + Reasoning. Anbieter-Dokumentation · abgerufen am 09.08.2026
  5. Google: Gemini API – Long context. Anbieter-Dokumentation · abgerufen am 09.08.2026
  6. Anthropic: Prompt caching – Effizienz, kein zusätzlicher Speicher. Anbieter-Dokumentation · abgerufen am 09.08.2026
  7. Anthropic: Context editing – Kontext gezielt kürzen (vergrößert das Fenster nicht). Anbieter-Dokumentation · abgerufen am 09.08.2026
  8. Google: Gemini API – Understand and count tokens (auch multimodal). Anbieter-Dokumentation · abgerufen am 09.08.2026
  9. Liu et al. (arXiv/TACL): „Lost in the Middle: How Language Models Use Long Contexts“ (2023). Wissenschaftliche Primärquelle · abgerufen am 09.08.2026
  10. Hsieh et al. (arXiv): „RULER: What's the Real Context Size of Your Long-Context Language Models?“ (2024). Wissenschaftliche Primärquelle · abgerufen am 09.08.2026
  11. Chroma (Hong, Troynikov, Huber): „Context Rot: How Increasing Input Tokens Impacts LLM Performance“ (Juli 2025). Technischer Report · abgerufen am 09.08.2026
  12. Li et al. (arXiv/EMNLP): „Retrieval Augmented Generation or Long-Context LLMs? A Comprehensive Study and Hybrid Approach“ (2024). Wissenschaftliche Primärquelle · abgerufen am 09.08.2026
  13. Sennrich et al. (arXiv/ACL): „Neural Machine Translation of Rare Words with Subword Units“ (BPE) (2016). Wissenschaftliche Primärquelle · abgerufen am 09.08.2026
  14. Kudo & Richardson (arXiv/EMNLP): „SentencePiece: A simple and language independent subword tokenizer“ (2018). Wissenschaftliche Primärquelle · abgerufen am 09.08.2026

Häufige Fragen

Was ist ein Token bei KI?

Die kleinste Einheit, in die ein Tokenizer Text (und andere Daten) zerlegt – oft ein Wortteil, manchmal ein ganzes Wort, ein Zeichen oder Satzzeichen.

Ist ein Token dasselbe wie ein Wort?

Nein. Ein Wort kann aus einem oder mehreren Tokens bestehen, und ein Token kann auch nur ein Wortteil oder Satzzeichen sein.

Wie viele Wörter sind 1.000 Tokens?

Nur grob schätzbar und stark sprach- und tokenizerabhängig. Für Englisch nennen Anbieter grob „100 Tokens ≈ 75 Wörter“; für Deutsch kann die Zahl abweichen.

Warum zählt derselbe Text bei verschiedenen Modellen unterschiedlich viele Tokens?

Weil Modelle unterschiedliche Tokenizer mit unterschiedlichem Vokabular verwenden. Dieselbe Zeichenfolge wird dadurch verschieden zerlegt.

Was ist ein Tokenizer?

Die Komponente, die Text in die vom Modell genutzten Tokens (bzw. Token-IDs) umwandelt. Der Tokenizer ist nicht das Modell selbst.

Was ist ein Kontextfenster?

Die begrenzte Menge an Tokens, die ein Modell bei einer Anfrage gleichzeitig berücksichtigen kann – je nach Anbieter inklusive Eingabe, Ausgabe und Reasoning.

Ist das Kontextfenster das Gedächtnis der KI?

Nein. Es ist der aktuell verfügbare Arbeitskontext, kein dauerhaftes Gedächtnis. Dauerhaftes Speichern übernehmen Memory-Funktionen oder externe Datenbanken.

Was ist der Unterschied zwischen Kontextfenster und Knowledge Cutoff?

Das Kontextfenster sagt, wie viel Information aktuell bereitgestellt werden kann. Der Knowledge Cutoff sagt, bis wann das im Training gelernte Wissen ungefähr reicht.

Gehört die Antwort zum Kontextfenster?

Bei vielen Modellen ja – Ausgabe und teils Reasoning-Tokens teilen sich das Budget mit dem Input. Deshalb sollte Platz für die Antwort reserviert werden.

Was passiert, wenn das Kontextfenster voll ist?

Das hängt vom System ab: Fehler, gekürzte Ausgabe, Entfernen älterer Nachrichten, Zusammenfassen oder Compaction. Es gibt kein einheitliches Verhalten.

Ist ein größeres Kontextfenster immer besser?

Nein. Mehr Kontext kann helfen, aber auch Kosten und Latenz erhöhen und relevante Informationen schwerer auffindbar machen. Relevanz schlägt Menge.

Verbrauchen Bilder ebenfalls Tokens?

Ja, je nach Anbieter werden Bilder, PDFs, Audio oder Video in Token- bzw. Nutzungseinheiten umgerechnet – nach anbieterspezifischen Regeln.

Spart Prompt Caching Kontext?

Nein. Caching senkt Kosten und Latenz für wiederkehrende Eingaben, schafft aber keine zusätzliche Kontextkapazität und kein Gedächtnis.

Wann ist RAG besser als ein großes Kontextfenster?

Bei sehr großen oder häufig aktualisierten Beständen, wenn nur wenige Passagen relevant sind oder Quellen gezielt ausgegeben werden sollen – oft auch aus Kostengründen.