Kontextfenster-Visualizer
Sieh, wie viele Tokens dein Gespräch belegt — und warum große Kontextfenster trotzdem ein Gedächtnisproblem haben.
Kontextfenster-Auslastung
0 / 0 Tokens
Noch kein Inhalt — tippe einen
System-Prompt oder füge unten einen Turn hinzu.
Näherungswert: Tokenisierung nicht verfügbar,
Schätzung über Wortanzahl (1 Wort ≈ 1.3 Token).
Kontextlimit überschritten — ältere Inhalte
werden abgeschnitten.
Multi-Turn-Simulation
Füge Gesprächsrunden hinzu und beobachte, wie die History das Kontextfenster füllt. Im Truncation-Modus werden die ältesten Runden abgeschnitten.
Noch keine Konversation. Füge unten den ersten Turn hinzu.
Wechselt automatisch nach jedem Turn.
Context Rod — Needle in a Haystack
simulierte Benchmark-DatenEin großes Kontextfenster bedeutet nicht gleichmäßig gutes Gedächtnis. Diese Heatmap zeigt, wie gut eine Information abgerufen wird — je nach Position und Kontextlänge.
So liest du diese Grafik
- X-Achse (Spalten): Wo im Kontextfenster steckt die gesuchte Information — 0% = ganz am Anfang, 50% = Mitte, 100% = ganz am Ende.
- Y-Achse (Zeilen): Wie groß ist der gesamte Kontext, in dem gesucht wird (1k, 4k, 16k, 64k, 128k Tokens). Oben = sehr groß, unten = klein.
- Zelle: Der Recall-Wert in Prozent — wie zuverlässig das Modell den Fakt an dieser Position wiederfindet. Grün = gut, gelb = wackelig, rot = oft vergessen.
- „Du bist hier“: Die gestrichelte Linie zeigt, wo dein aktueller Kontext (aus dem Balken oben) in dieser Skala steht.
- Interaktion: Klicke auf eine Zelle für eine Erklärung, oder fahre mit der Maus drüber für Details.
Lädt…
Heatmap-Daten werden geladen…
Heatmap-Daten konnten nicht geladen werden.
niedriger Recall
hoher Recall
Hintergrund
Das Kontextfenster ist die maximale Anzahl an Tokens, die
ein Modell gleichzeitig "sehen" kann — System-Prompt,
gesamter Gesprächsverlauf und die aktuelle Frage
zusammen. Ist es voll, müssen ältere Inhalte
abgeschnitten werden und gehen für das Modell verloren.
Modelle verarbeiten keine Wörter oder Zeichen, sondern
Tokens — häufige Wortteile. Ein kurzes Wort ist
oft 1 Token, ein langes mehrere, ein Emoji 2–3 Tokens.
Deshalb ist die Token-Anzahl die einzige verlässliche
Maßeinheit für die Kontextgröße.
Studien (u. a. Liu et al. 2023, "Lost in the Middle")
zeigen: LLMs erinnern sich am besten an Inhalte am Anfang
und Ende des Kontexts. Information in der Mitte wird oft
"übersehen". Konsequenz für die Praxis: Wichtige
Fakten an den Anfang oder das Ende stellen — oder
Retrieval Augmented Generation (RAG) nutzen, um nur
relevante Auszüge in den Kontext zu geben.