Kontextfenster-Visualizer

Sieh, wie viele Tokens dein Gespräch belegt — und warum große Kontextfenster trotzdem ein Gedächtnisproblem haben.

Kontextfenster-Auslastung

0 / 0 Tokens
Noch kein Inhalt — tippe einen System-Prompt oder füge unten einen Turn hinzu.
Näherungswert: Tokenisierung nicht verfügbar, Schätzung über Wortanzahl (1 Wort ≈ 1.3 Token).

Multi-Turn-Simulation

Füge Gesprächsrunden hinzu und beobachte, wie die History das Kontextfenster füllt. Im Truncation-Modus werden die ältesten Runden abgeschnitten.

Noch keine Konversation. Füge unten den ersten Turn hinzu.
    Wechselt automatisch nach jedem Turn.

    Context Rod — Needle in a Haystack

    simulierte Benchmark-Daten

    Ein großes Kontextfenster bedeutet nicht gleichmäßig gutes Gedächtnis. Diese Heatmap zeigt, wie gut eine Information abgerufen wird — je nach Position und Kontextlänge.

    So liest du diese Grafik
    • X-Achse (Spalten): Wo im Kontextfenster steckt die gesuchte Information — 0% = ganz am Anfang, 50% = Mitte, 100% = ganz am Ende.
    • Y-Achse (Zeilen): Wie groß ist der gesamte Kontext, in dem gesucht wird (1k, 4k, 16k, 64k, 128k Tokens). Oben = sehr groß, unten = klein.
    • Zelle: Der Recall-Wert in Prozent — wie zuverlässig das Modell den Fakt an dieser Position wiederfindet. Grün = gut, gelb = wackelig, rot = oft vergessen.
    • „Du bist hier“: Die gestrichelte Linie zeigt, wo dein aktueller Kontext (aus dem Balken oben) in dieser Skala steht.
    • Interaktion: Klicke auf eine Zelle für eine Erklärung, oder fahre mit der Maus drüber für Details.
    Lädt…

    Heatmap-Daten werden geladen…

    niedriger Recall hoher Recall

    Hintergrund

    Das Kontextfenster ist die maximale Anzahl an Tokens, die ein Modell gleichzeitig "sehen" kann — System-Prompt, gesamter Gesprächsverlauf und die aktuelle Frage zusammen. Ist es voll, müssen ältere Inhalte abgeschnitten werden und gehen für das Modell verloren.

    Modelle verarbeiten keine Wörter oder Zeichen, sondern Tokens — häufige Wortteile. Ein kurzes Wort ist oft 1 Token, ein langes mehrere, ein Emoji 2–3 Tokens. Deshalb ist die Token-Anzahl die einzige verlässliche Maßeinheit für die Kontextgröße.

    Studien (u. a. Liu et al. 2023, "Lost in the Middle") zeigen: LLMs erinnern sich am besten an Inhalte am Anfang und Ende des Kontexts. Information in der Mitte wird oft "übersehen". Konsequenz für die Praxis: Wichtige Fakten an den Anfang oder das Ende stellen — oder Retrieval Augmented Generation (RAG) nutzen, um nur relevante Auszüge in den Kontext zu geben.