Logo

Dienstag, Januar 13, 2026

Wieder einmal nachgewiesen: Trainingsdaten enthalten geschützte Daten, zum Teil können ganze Bücher extrahiert werden

Ein Forscherteam der Stanford University untersuchte, ob Trainingsdaten während des Trainings in den Gewichten des Modells kodiert werden und ob diese gespeicherten Daten aus den Modellausgaben extrahiert werden können. Aktuelle Arbeiten, so das Forscherteam, aktuelle Arbeiten, zeigen, dass aus Modellen mit offenen Gewichten erhebliche Mengen an urheberrechtlich geschütztem Text extrahiert werden können. Fraglich sei jedoch, ob eine ähnliche Extraktion für Produktions-LLMs angesichts der Sicherheitsmaßnahmen, die diese Systeme implementieren, möglich ist.
Diese Frage wurde anhand eines zweistufigen Verfahrens untersucht:

  1. einer ersten Prüfung der Extraktionsmöglichkeit, bei der manchmal ein Best-of-N (BoN)-Jailbreak verwendet wird, gefolgt von
  2. terativen Fortsetzungsaufforderungen, um zu versuchen, das Buch zu extrahieren.

Untersucht wurden vier Produktions-LLMs: Claude 3.7 Sonnet, GPT-4.1, Gemini 2.5 Pro und Grok 3.
Für die Phase-1-Untersuchung war es nicht notwendig, Gemini 2.5 Pro und Grok 3 zu jailbreaken, um Text zu extrahieren (z. B. nv-Recall von 76,8 % bzw. 70,3 % für Harry Potter und der Stein der Weisen), während dies für Claude 3.7 Sonnet und GPT-4.1 notwendig war.
In einigen Fällen gibt das gejailbreakte Claude 3.7 Sonnet ganze Bücher nahezu wortwörtlich aus (z. B. nv-Recall=95,8 %).
URL: