prompt injections.de
Glossar

Datenvergiftung

Datenvergiftung ist die Manipulation von Daten, die ein KI-System vor oder während seiner Nutzung prägen: etwa Vortrainings-, Feintuning-, Embedding-, Evaluations- oder Wissensdaten. Ziel kann sein, Leistungsfähigkeit und Entscheidungen zu verschlechtern, systematische Verzerrungen einzubringen oder ein konditioniertes Fehlverhalten vorzubereiten. Die Manipulation liegt damit nicht notwendig in der aktuellen Nutzereingabe, sondern kann bereits in einer Datenquelle oder einem trainierten Artefakt verankert sein.

Einordnung

OWASP führt Data and Model Poisoning als LLM05:2026 und beschreibt die Manipulation von Vortrainings-, Feintuning- oder Embeddingdaten zur Einführung von Schwachstellen, Backdoors oder Bias. Die Organisation ordnet sie als Integritätsangriff ein und weist besonders auf externe, nicht verifizierte Datenquellen hin.1 Das grenzt Datenvergiftung von Prompt Injection ab: Injection versucht, das Verhalten zur Laufzeit durch Kontext zu verschieben; Vergiftung betrifft die Herkunft oder Verarbeitung der Daten, aus denen ein Modell lernt oder Wissen bezieht. Beide Risiken können sich verbinden, etwa wenn untrusted Inhalte in eine dauerhaft genutzte Wissensbasis gelangen.

Der Begriff umfasst mehr als die klassische Veränderung eines großen Vortrainingskorpus. In LLM-Anwendungen sind oft nachgelagerte Schritte realistischer: kundenspezifisches Feintuning, laufende Inhaltsaufnahme, Dokumentindizes oder Nutzerbeiträge. NIST führt Datenvergiftung in seiner aktuellen Taxonomie des adversarialen Machine Learning als Angriffsklasse über Lernparadigmen hinweg.2 Nicht jede fehlerhafte Datenquelle ist damit automatisch ein Angriff; redaktionelle Fehler, Bias oder schlechte Datenqualität können ähnliche Symptome erzeugen. Für die Sicherheitsbewertung ist jedoch dieselbe Frage zentral: Wer konnte welchen Datenbestand wann und unter welchen Kontrollen verändern?

Dokumentiertes Beispiel

OWASP beschreibt als Folgen manipulierter Daten unter anderem beeinträchtigte Modellqualität, verzerrte oder toxische Ausgaben sowie Backdoors. Solche Backdoors können zunächst unauffällig bleiben und ihr Verhalten erst bei einem Auslöser ändern, was die Prüfung erschwert.1 Dieses Beispiel ist bewusst allgemein: Aus einer Dokumentation lässt sich nicht ableiten, dass jede Abweichung im Modellverhalten durch Vergiftung verursacht wurde. Es zeigt vielmehr den möglichen Übergang von Datenmanipulation zu einem späteren, selektiven Sicherheitsproblem.

Bedeutung für die Abwehr

Der wichtigste Abwehrhebel liegt vor der Inferenz: nachvollziehbare Herkunft, Zugriffsschutz, Versionsverwaltung und Freigaben für Datenänderungen. OWASP empfiehlt, Datenursprünge und Transformationen nachzuverfolgen, Anbieter zu prüfen, Datenversionierung einzusetzen, Anomalien zu filtern und robuste Tests durchzuführen.1 Ergänzend sollte die Anwendung nutzergelieferte Inhalte nicht ohne Prüfschritt in Trainings- oder Wissenspipelines übernehmen. Für Vorfälle braucht es eine Rückverfolgbarkeit von Modellversion zu Datensatz, Transformationsschritt und Freigabe. Damit wird Vergiftung nicht garantiert verhindert; sie wird jedoch erkennbarer, eingrenzbarer und durch Rollback behandelbar. Diese Kontrolle ist zugleich Teil einer sicheren KI-Lieferkette.

Quellen

  1. OWASP Gen AI Security Project, „LLM05:2026 Data and Model Poisoning“, 3. August 2026, https://genai.owasp.org/resource/owasp-genai-llm-top-10-2026/
  2. Apostol Vassilev et al., „Adversarial Machine Learning: A Taxonomy and Terminology of Attacks and Mitigations“, NIST AI 100-2e2025, 2025, https://nvlpubs.nist.gov/nistpubs/ai/NIST.AI.100-2e2025.pdf