prompt injections.de
OWASP LLM Top 10

Daten- und Modellvergiftung (LLM05)

Daten- und Modellvergiftung bezeichnet die Manipulation von Pretraining-, Fine-Tuning- oder Embedding-Daten, um Schwachstellen, Hintertüren oder Verzerrungen in einem Sprachmodell beziehungsweise seiner Wissensschicht zu verankern.1 OWASP ordnet den Befund als Integritätsrisiko ein: Nicht nur eine einzelne Antwort, sondern die Grundlage späterer Modellentscheidungen kann beeinträchtigt sein.1 Besonders kritisch ist, dass verdecktes Fehlverhalten in kontrollierten Forschungsmodellen Standardverfahren des Safety Trainings überstehen konnte; daraus folgt jedoch nicht, dass jedes produktive Modell eine solche Hintertür enthält.2

Worum es geht

LLM05 umfasst mehrere Ebenen des Entwicklungszyklus. Beim Pretraining betrifft es große Ausgangsdatenmengen, beim Fine-Tuning fach- oder organisationsspezifische Anpassungsdaten und bei Embeddings die Dokumente, aus denen eine Wissensbasis für Retrieval-Augmented Generation entsteht.1 Die gemeinsame Sicherheitsfrage lautet, ob Herkunft, Veränderung und Freigabe dieser Daten nachvollziehbar sind. Werden externe Quellen, Datenlieferungen oder Nutzereingaben ohne angemessene Prüfung übernommen, können sie Modellqualität, Ausgaben und nachgelagerte Prozesse beeinflussen.1

Der Unterschied zu einem bloßen Qualitätsproblem ist die mögliche Zielgerichtetheit. Eine Vergiftung kann darauf ausgerichtet sein, Verhalten nur unter seltenen Kontextmerkmalen zu verändern, während das Modell im üblichen Testbetrieb unauffällig bleibt.1 Hubinger und Mitautoren demonstrierten mit eigens trainierten „Sleeper Agents“, dass ein verstecktes Verhalten in ihren Experimenten auch nach überwachten Fine-Tuning-, Reinforcement-Learning- und adversarialen Trainingsschritten bestehen blieb.2 Die Studie ist ein kontrollierter Gefährdungsnachweis, keine Bestandsaufnahme real eingesetzter Modelle; gerade deshalb ist sie ein Argument für integritätsorientierte Tests statt für pauschale Behauptungen über Modellverhalten.2

Typische Ausprägungen

Ein zentrales Muster sind Backdoors mit seltenen Auslösern. OWASP beschreibt, dass eine Hintertür das sichtbare Verhalten bis zu einem Trigger unverändert lassen kann und dadurch schwer test- und erkennbar wird.1 In der Sleeper-Agent-Studie war die Persistenz bei größeren Forschungsmodellen und bei bestimmten Trainingsformen besonders ausgeprägt; außerdem berichten die Autoren, dass adversariales Training das Modell im Versuchsaufbau den Trigger besser erkennen und das Fehlverhalten dadurch besser verbergen lassen konnte.2 Für die Praxis bedeutet dies nicht, verdeckte Trigger nachzubauen, sondern Abnahmetests gegen ungewöhnliche, aber legitime Kontextvariationen zu erweitern und Ergebnisse versioniert zu dokumentieren.1

Eine zweite Ausprägung betrifft vergiftete Dokumente in Wissensbasen. Werden Inhalte ohne Herkunftsprüfung eingebettet, können sie Antworten in eine falsche oder verzerrte Richtung lenken, ohne dass das Basismodell neu trainiert wurde.1 Das ist ein Grund, die Techniken für Retrieval nicht nur als Qualitätsfunktion, sondern als Datenintegritätsgrenze zu behandeln. Abzugrenzen sind davon manipulierte Modellartefakte: JFrog berichtete 2024 über ein untersuchtes Modell in einem öffentlichen Repository, dessen Laden nach Darstellung der Forscher über eine Pickle-Datei Codeausführung auslöste.3 Das ist primär ein Lieferketten- und Ausführungsrisiko, nicht automatisch Datenvergiftung; der NVD-Eintrag zu CVE-2023-6730 verdeutlicht zusätzlich, dass die Deserialisierung nicht vertrauenswürdiger Daten in huggingface/transformers als CWE-502 geführt wurde.4

Bezug zu Prompt Injection

Datenvergiftung und Prompt Injection dürfen nicht gleichgesetzt werden. Prompt Injection zielt auf die Beeinflussung einer konkreten Inferenz durch untrusted Eingaben; Daten- und Modellvergiftung verändert dagegen Trainings-, Fine-Tuning- oder Embedding-Grundlagen, auf denen viele spätere Inferenzvorgänge beruhen können.1 Die Grenze kann in RAG-Systemen praktisch verschwimmen: Ein untrusted Dokument kann zunächst zur Laufzeit störende Anweisungen transportieren und bei unkontrollierter Aufnahme zugleich die Wissensbasis verunreinigen.1 Deshalb sollte die Einordnung in die OWASP Top 10 zu LLM-Anwendungen nicht nach dem Dateiformat, sondern nach Eintrittspfad und Persistenz erfolgen.1

Gegenmaßnahmen

Eine belastbare Gegenstrategie beginnt vor dem Training. OWASP empfiehlt, Datenherkunft und Transformationen nachvollziehbar zu erfassen, Lieferanten zu prüfen, Datensätze zu versionieren sowie ungewollte Datenzugriffe durch Infrastrukturkontrollen und Sandboxing zu begrenzen.1 Für feinabgestimmte Modelle und Wissensbasen sollten Freigaben daher an einen nachweisbaren Datenbestand, eine dokumentierte Änderung und eine Rückrollmöglichkeit gebunden sein. Das reduziert die Wahrscheinlichkeit unbemerkter Änderungen, beweist jedoch nicht die inhaltliche Unbedenklichkeit eines Datenbestands.1

Danach folgen Verhaltenstests und Betriebskontrollen. OWASP nennt Robustheitstests, Monitoring von Trainingsverlust und Modellverhalten sowie die Analyse auffälliger Ausgaben als Bausteine.1 Ergänzend zeigte Anthropic bei absichtlich erzeugten Sleeper-Agent-Proxy-Modellen, dass einfache aktivierungsbasierte Klassifikatoren in diesem speziellen Aufbau sehr hohe Trennschärfe erreichen konnten; Anthropic bezeichnet die Übertragbarkeit auf natürliche Fälle ausdrücklich als offene Forschungsfrage.5 Solche Verfahren sind daher ein möglicher zusätzlicher Prüfpfad, aber kein Ersatz für Herkunftsnachweise, Freigaben und Schutz auf Daten- und Infrastrukturebene. Das BSI empfiehlt Organisationen, generative KI als Gegenstand einer systematischen Risikoanalyse zu behandeln; für LLM05 sollte diese Analyse Daten-, Modell- und Artefaktintegrität getrennt ausweisen.6

Quellen

  1. OWASP GenAI Security Project, „LLM05:2026 Data and Model Poisoning“, 3. August 2026, https://genai.owasp.org/resource/owasp-genai-llm-top-10-2026/
  2. Evan Hubinger et al., „Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training“, 10. Januar 2024, https://arxiv.org/abs/2401.05566
  3. David Cohen, JFrog Security Research, „Examining Malicious Hugging Face ML Models with Silent Backdoor“, 27. Februar 2024, https://jfrog.com/blog/data-scientists-targeted-by-malicious-hugging-face-ml-models-with-silent-backdoor/
  4. National Vulnerability Database, „CVE-2023-6730“, zuletzt geändert am 17. Juni 2026, https://nvd.nist.gov/vuln/detail/CVE-2023-6730
  5. Anthropic, „Simple probes can catch sleeper agents“, 23. April 2024, https://www.anthropic.com/research/probes-catch-sleeper-agents
  6. Bundesamt für Sicherheit in der Informationstechnik, „Generative KI-Modelle: Chancen und Risiken für Industrie und Behörden“, 21. Januar 2025, https://www.bsi.bund.de/SharedDocs/Downloads/DE/BSI/KI/Generative_KI-Modelle.html