RAG Demo

Verstehe Retrieval-Augmented Generation Schritt für Schritt — mit echten Embeddings, 2D-Visualisierung und einem direkten Vergleich gegen klassische Keyword-Suche.

Bitte zuerst bei ki.1mein.de anmelden, um die Demo zu nutzen. Zu ki.1mein.de anmelden
Modus:
Lokale Simulation: keine API-Kosten, keine Anmeldung nötig.

Was ist RAG?

RAG (Retrieval-Augmented Generation) gibt einem LLM externes Wissen mit. Statt sich nur auf das Training zu verlassen, holt die App vor jeder Antwort die passenden Text-Schnipsel aus einer Wissensbasis und fügt sie in den Prompt ein. Das macht Antworten aktueller, belegbar und auf eigene Daten zugeschnitten.

1 Wissensbasis aufbauen

Bearbeite die Beispieldokumente oder füge eigene hinzu (max. 10). Jedes Dokument fließt später als Wissen in die Antworten ein.

0/10

2 Chunking

Lange Texte werden in Chunks aufgeteilt — kleine Sinneinheiten, die einzeln eingebettet und abgerufen werden können. Kleinere Chunks sind präziser, größere geben mehr Kontext. Hier siehst du beide Effekte live.

0 Chunks

3 Embeddings berechnen

Jeder Chunk wird durch einen Vektor (1536 Zahlen) repräsentiert, der seine Bedeutung kodiert. Ähnliche Texte ergeben ähnliche Vektoren — und liegen in der Karte unten nah beieinander.

Kosten werden berechnet…
Fertig

Noch keine Embeddings berechnet.

Vektor-Vorschau pro Chunk

PCA-Projektion

Bewege die Maus über einen Punkt, um den Text zu sehen. Punkte gleicher Farbe stammen aus demselben Dokument.

Ziehen: drehen · Scrollen: zoomen
Hinweis: Die 1536-D-Vektoren werden mit PCA auf 2 bzw. 3 Dimensionen reduziert — die Karte zeigt die wichtigsten Bedeutungs-Achsen, nicht alle Details.

4 Frage + Retrieval

Stelle eine Frage und vergleiche, wie eine klassische Keyword-Suche gegen ein semantisches Retrieval mit Embeddings abschneidet.

Beispiele:

Keyword-Suche

Findet Chunks mit wortwörtlichen Übereinstimmungen.

Noch keine Frage gestellt.

RAG-Retrieval (Embeddings)

Findet Chunks, die bedeutungsähnlich sind — auch ohne wörtliche Übereinstimmung.

Noch keine Frage gestellt.

Frage im Vektorraum

Die Frage erscheint als Stern; Linien verbinden sie mit den Top-3 ähnlichsten Chunks.

Ziehen: drehen · Scrollen: zoomen

5 Augmentierte Antwort

Die abgerufenen Chunks werden als Kontext in den Prompt eingefügt. Zum Vergleich fragen wir das LLM parallel ohne Kontext — du siehst direkt, was der Unterschied bringt.

[noch nicht generiert]
Dieser Vergleich nutzt 2× Tokens (mit + ohne Kontext).

Mit RAG-Kontext

Noch keine Antwort.

Lädt…

Antwort wird abgefragt…


                                

Ohne Kontext

Noch keine Antwort.

Lädt…

Antwort wird abgefragt…