RAG-Vergiftung
RAG-Vergiftung bezeichnet die gezielte Manipulation des Dokumentbestands eines Retrieval-Augmented-Generation-Systems. Präparierte Inhalte werden so in den Retrieval-Korpus eingebracht oder verändert, dass sie bei bestimmten Anfragen mit hoher Wahrscheinlichkeit abgerufen und dem Modell als Kontext vorgelegt werden.1 Der Angriff richtet sich damit nicht primär gegen die Gewichte des Modells, sondern gegen die Wissensschicht, auf die die Anwendung zugreift.
Einordnung
Im Unterschied zu einer unmittelbaren Prompt Injection stammt die beeinflussende Anweisung oder Falschinformation nicht aus der aktuellen Nutzereingabe, sondern aus einer Datenquelle des Systems. RAG-Vergiftung ist auch enger als allgemeine Datenvergiftung: Entscheidend ist nicht irgendeine Verschlechterung eines Trainings- oder Datenbestands, sondern die steuerbare Auswahl vergifteter Dokumente im Retrieval. Ein einzelner erfolgreicher Abruf kann sowohl die Antwortqualität verfälschen als auch, bei verbundenen Werkzeugen, eine nachgelagerte Handlung beeinflussen.
Die Sicherheitsrelevanz entsteht aus der Vertrauensverschiebung. RAG soll Antworten mit externem Wissen erden; dadurch behandelt die Anwendung abgerufene Texte oft als fachlich besonders relevante Grundlage. Diese Nähe zum Kontext macht den Schreib- und Ingestionpfad ebenso kritisch wie den Modellprompt. Ein Modellwechsel entfernt einen manipulierten Korpus nicht. Ebenso wenig genügt es, die Trefferqualität allgemein zu erhöhen: Ein sehr gut auffindbarer manipulierter Text bleibt ein Sicherheitsproblem.
Dokumentiertes Beispiel
Die Arbeit PoisonedRAG formulierte gezielte Wissenskorruption als Optimierungsproblem: Für eine gewählte Zielfrage sollen eingeschleuste Texte eine vorgegebene Zielantwort begünstigen. In den beschriebenen Versuchen erreichten die Autoren eine Angriffserfolgsquote von 90 Prozent, indem sie fünf präparierte Texte je Zielfrage in eine Wissensbasis mit Millionen Texten einbrachten.1 Das ist kein Nachweis für jede RAG-Architektur, belegt aber, dass Größe des Korpus allein kein wirksamer Schutz ist.
OWASP beschreibt denselben Angriffspfad als Document Poisoning: Wird ein manipuliertes Dokument später abgerufen, gelangt sein Inhalt in das Kontextfenster und kann das Modellverhalten verändern.2 Ein naheliegender Risikofall ist daher ein gemeinsam gepflegtes Wissenssystem, dessen Inhalte ohne geprüfte Herkunft automatisiert in den RAG-Index übernommen werden.
Bedeutung für die Abwehr
Die erste Kontrollgrenze liegt vor dem Index: Schreibrechte, zugelassene Quellen und Freigaben müssen vom Lesezugriff getrennt werden. OWASP empfiehlt hierfür unter anderem Integritätsprüfungen bei der Ingestion, Provenienzangaben zu Quelle und Freigabe sowie Regeln für vertrauenswürdige Dokumentquellen.2 Zusätzlich sollten Retrieval-Treffer mit Herkunft, Aktualität und Berechtigung kontextualisiert werden. Die entscheidende Frage lautet nicht nur, ob ein Text verdächtig wirkt, sondern ob er überhaupt mit ausreichendem Vertrauen als Modellkontext dienen darf.
Quellen
- Wei Zou, Runpeng Geng, Binghui Wang und Jinyuan Jia, „PoisonedRAG: Knowledge Corruption Attacks to Retrieval-Augmented Generation of Large Language Models“, 2025, https://www.usenix.org/conference/usenixsecurity25/presentation/zou-poisonedrag ↩
- OWASP Cheat Sheet Series, „RAG Security Cheat Sheet“, o. D., https://cheatsheetseries.owasp.org/cheatsheets/RAG_Security_Cheat_Sheet.html ↩