KI-Wasserzeichen

Ein Text-Wasserzeichen ist kein verstecktes Zeichen im Text, sondern eine statistische Verschiebung in den Wortentscheidungen — und seine Erkennung ist ein Wahrscheinlichkeitsurteil, kein Beweis.

Workshop-Steuerung

Ansicht
Farbschema
Zustand
Szenarien (ein Klick)

Lädt…

Sprachmodell wird geladen…

1. Schlüssel & Färbung

Der Geheimschlüssel teilt das Vokabular bei jedem Schritt neu in eine Grün- und eine Rot-Liste. Die Färbung ist pseudozufällig, hängt vom vorherigen Token ab und ist ohne den Schlüssel nicht reproduzierbar.

Frei wählbar. Nur wer ihn kennt, kann das Wasserzeichen setzen oder prüfen.
Wie groß ist die Grün-Liste? 0,5 heißt: die Hälfte des Vokabulars.
Wie viele vorangehende Tokens gehen in die Färbung ein? Mehr Kontext ist schwerer anzugreifen, aber empfindlicher gegen jede Textänderung.
Aktuelles Kontext-Token

Hinweis zur Umsetzung: LLMSim nutzt eine schnelle, NICHT kryptografische Streufunktion (FNV-1a), damit das Raster beim Reglerziehen unter 200 ms neu einfärbt. Ein echtes Produkt bräuchte eine kryptografische Funktion mit Schlüssel — sonst könnte ein Angreifer die Färbung rekonstruieren.

2. Generierung mit Wasserzeichen

Markiert wird hier das eigene n-Gramm-Modell von LLMSim. Mit der OpenAI-API ist das nicht möglich: ein Wasserzeichen muss den Moment der Wortwahl steuern, und die API erlaubt keinen kontextabhängigen Logit-Bias pro Token. GPT taucht deshalb nur als Prüfling (Schritt 3) und als Angreifer (Schritt 4) auf.
Verfahren

δ = 0 bedeutet: kein Wasserzeichen. Hohe Werte sind besser nachweisbar, machen den Text aber unnatürlich.
Anzahl erzeugter Tokens. Je länger der Text, desto sicherer die spätere Erkennung.

Ohne Eingriff (Modell pur)

Mit Eingriff (Wasserzeichen)

Noch kein Schritt berechnet — starte die Generierung, um die beiden Verteilungen zu sehen.

δ ändern zeichnet beide Diagramme sofort neu — ohne den Text neu zu erzeugen und ohne API-Aufruf.

Noch kein Text erzeugt.

Ohne Wasserzeichen (δ = 0)

Mit Wasserzeichen

Beide Texte stammen aus demselben Modell, demselben Prompt und demselben Startwert. Der einzige Unterschied ist δ.

3. Detektor

Der geprüfte Text und der Schlüssel verlassen deinen Browser nicht. Es wird nichts hochgeladen und nichts gespeichert. Dies ist eine Lern-Demo, kein Prüfwerkzeug für echte Dokumente.
Noch nichts geprüft.
Tokens
Grüne Tokens
Grün-Anteil
z-Score
p-Wert
z gegen Schwelle
Der Text scheint nicht zum aktiven n-Gramm-Modell zu passen. Die Auswertung läuft trotzdem — die Tokenisierung ist sprachunabhängig. Wichtig ist nur, dass Erzeuger und Prüfer dieselbe Tokenisierung und denselben Schlüssel verwenden.

z über Textlänge — das Anwachsen mit √N

Der z-Score wächst ungefähr mit der Wurzel aus der Textlänge: doppelt so viel Text bringt nur rund 1,4-mal so viel Sicherheit.

Geprüfter Text, Token für Token


Optional: echten GPT-Text prüfen

Lässt gpt-4o-mini einen kurzen Text schreiben und prüft ihn mit dem aktuellen Schlüssel. Erwartetes Ergebnis: kein Wasserzeichen.

Kostenschätzung: ca. 0,0002 – 0,0005 USD pro Aufruf (gpt-4o-mini, max. 512 Tokens).

Nur diese Zusatzfunktion braucht eine Anmeldung. Die Schritte 1–5 funktionieren ohne Login vollständig. Bei ki.1mein.de anmelden

4. Angriffslabor

Erzeuge zuerst in Schritt 2 einen markierten Text — er ist der Ausgangspunkt für die Angriffe.
Angriffe
z im Original
z nach Angriff
Überlebender Anteil f
Verdikt
Robustheitsformel mit den aktuellen Zahlen
f = Anteil der Tokens, deren Kontext der Angriff unberührt ließ; N = Anzahl geprüfter Tokens; z₁ = Signalstärke pro Token im Original.

z-Verlauf über die Angriffsstärke

Original gegen angegriffenen Text

Original
Angegriffen
Leichtes Editieren verdünnt das Zeichen, eine vollständige Neuformulierung löscht es: nach einer gründlichen Umschreibung überleben nur etwa 0,5 % der Fenster.
Die Gegenrichtung gilt aber auch: mit wachsender Textlänge wird selbst ein verdünntes Wasserzeichen wieder nachweisbar — bei menschlicher Paraphrase etwa ab 800 Tokens.

Optional: mit GPT paraphrasieren

Lässt gpt-4o-mini den markierten Text umformulieren und stellt den z-Score des Ergebnisses gegen den regelbasierten Angriff.

Kostenschätzung: ca. 0,0002 – 0,0005 USD pro Aufruf (gpt-4o-mini, max. 512 Tokens).

Nur diese Zusatzfunktion braucht eine Anmeldung. Die Schritte 1–5 funktionieren ohne Login vollständig. Bei ki.1mein.de anmelden

5. Duell: Welcher Text ist markiert?

Zwei Texte, derselbe Prompt, dasselbe Modell — genau einer trägt ein Wasserzeichen. Rate zuerst, dann sieh dir die Zahlen an.

Noch keine Runde gestartet.
Text A
Text B

Hintergrund

Der z-Test

z = ( |s|G − γN ) / √( Nγ(1−γ) )

Ohne Wasserzeichen ist jedes Token mit Wahrscheinlichkeit γ grün. Der z-Score misst, wie viele Standardabweichungen der beobachtete Grün-Anteil über dem reinen Zufall liegt.

Zwei Verfahren

Kirchenbauer et al. (2023) addieren einen festen Bias δ auf die Logits aller grünen Kandidaten — einfach, wirksam, aber die Verteilung wird verzerrt. Googles SynthID zieht stattdessen mehrere Kandidaten aus der unveränderten Verteilung und lässt sie in einem Turnier gegeneinander antreten; gewinnen kann jeder, grüne Tokens aber häufiger.

Grenzen dieser Demo

  • Die Streufunktion ist schnell, aber nicht kryptografisch — für die Vorführbarkeit im Browser, nicht für den Ernstfall.
  • Das Turnier nutzt auf jeder Ebene dieselbe Grün-Funktion, damit ein einziger Detektor beide Verfahren prüfen kann. Das echte SynthID nutzt je Ebene eine eigene Funktion und ist dadurch verzerrungsfrei.
  • GPT-Text lässt sich hier nicht markieren: die OpenAI-API erlaubt keinen kontextabhängigen Logit-Bias pro Token.
  • Ein fehlendes Wasserzeichen ist kein Beleg für menschliche Autorschaft — es heißt nur, dass DIESER Schlüssel nichts findet.

Fachliche Grundlage: declaude.org/watermarking