Payload
Als Payload wird der wirksame Inhaltsanteil eines Angriffs bezeichnet: der Teil, der nach erfolgreicher Zustellung die gewünschte Manipulation auslösen soll. Bei Prompt Injection ist damit die eingeschleuste Anweisung oder inhaltliche Manipulation gemeint, die das Verhalten oder die Ausgabe eines Sprachmodells verändert. OWASP betont, dass ein solcher Inhalt für Menschen nicht sichtbar oder lesbar sein muss, solange das Modell ihn verarbeitet.1
Einordnung
Payload ist kein Synonym für den gesamten Angriffsweg. Die Zustellung kann über eine direkte Nutzereingabe oder indirekt über externe Inhalte wie Websites und Dateien erfolgen; OWASP unterscheidet diese Formen ausdrücklich.1 Der Payload ist dagegen der inhaltliche Teil, der nach der Aufnahme in den Modellkontext die ursprüngliche Aufgabe verdrängen, eine Ausgabe verfälschen oder eine Werkzeughandlung beeinflussen soll.
Für die Verteidigung ist diese Trennung praktisch wichtig. Eine Signatur erkennt nur bestimmte Formulierungen oder Darstellungen. Da dieselbe Absicht sprachlich unterschiedlich auftreten kann und Inhalte auch für Menschen kaum wahrnehmbar sein können, ist eine reine Payload-Suche keine zuverlässige Sicherheitsgrenze. Sie kann verdächtige Eingaben markieren, beantwortet aber nicht die zweite Frage: Welche Wirkung wäre möglich, wenn das Modell den Inhalt dennoch als Anweisung behandelt?
Der Begriff ist zudem von Obfuskation abzugrenzen. Obfuskation beschreibt die Verbergung oder Erschwerung der Erkennung; Payload beschreibt die eigentliche manipulative Funktion. Beide können zusammen auftreten, müssen es aber nicht. Auch ein offen sichtbarer Text kann einen Payload enthalten, während eine verschleierte Darstellung ohne wirksame Anweisung keine erfolgreiche Manipulation bewirkt.
Dokumentiertes Beispiel
OWASP beschreibt direkte Prompt Injection als Verhalten, das durch eine unmittelbare Eingabe verändert wird, und indirekte Prompt Injection als Einfluss aus externen Quellen. Die Organisation hält fest, dass solche Inhalte das Modell beeinflussen können, obwohl sie für Menschen nicht wahrnehmbar sind.1 Das dokumentiert die sicherheitsrelevante Eigenschaft, ohne einen konkreten Umgehungstext oder ein ausführbares Angriffsmuster zu benötigen.
Das OWASP-Präventionsblatt nennt die Überwachung von Kodierungsversuchen und HTML-Injection als einen Baustein des Monitorings. Zugleich bewertet es rein musterbasierte Filter als weniger zuverlässig und empfiehlt für indirekte Injections trainierte Erkennungsmodelle als zusätzliche Schutzebene.2
Bedeutung für die Abwehr
Payload-Erkennung ist sinnvoll, darf aber nicht die einzige Abwehr sein. OWASP empfiehlt neben Eingabeprüfung auch Ausgabe- und Aktionsprüfung sowie die Validierung von Werkzeugaufrufen gegen Nutzerrechte und Sitzungskontext.2 Least Privilege begrenzt, was ein erfolgreich beeinflusstes Modell überhaupt bewirken kann. Der robuste Maßstab lautet daher: verdächtige Inhalte erkennen, ihre Auswirkung durch minimale Rechte begrenzen und jede wirksame Aktion unabhängig vom Modelltext kontrollieren.
Quellen
- OWASP GenAI Security Project, „LLM01:2026 Prompt Injection“, 3. August 2026, https://genai.owasp.org/resource/owasp-genai-llm-top-10-2026/ ↩
- OWASP Cheat Sheet Series, „LLM Prompt Injection Prevention Cheat Sheet“, o. D., https://cheatsheetseries.owasp.org/cheatsheets/LLM_Prompt_Injection_Prevention_Cheat_Sheet.html ↩