prompt injections.de
Glossar

Tödliche Trias

Die Tödliche Trias bezeichnet die Kombination aus Zugang zu privaten Daten, Verarbeitung nicht vertrauenswürdiger Inhalte und einer Möglichkeit zur externen Kommunikation. Treffen alle drei Fähigkeiten in einem Agenten zusammen, kann eine erfolgreiche indirekte Prompt Injection einen Weg zum Datenabfluss eröffnen.1 Der Begriff ist ein Architekturmodell für Schadenspotenzial, keine Klassifikation jedes unerwünschten Modelloutputs.

Einordnung

Die drei Bestandteile sind voneinander zu unterscheiden. Private Daten umfassen etwa Postfächer, Dateien oder interne Repositorien; untrusted Content kann aus denselben Quellen, aus dem Web oder aus Werkzeugantworten stammen. Externe Kommunikation ist weiter als das Versenden einer E-Mail: Auch ein ausgehender Webabruf, das Laden externer Inhalte oder ein anderer unkontrollierter Zielkanal kann Daten nach außen tragen.1 Die Trias erklärt damit, warum ein Assistent ohne Schreib- oder Netzfunktion zwar weiterhin auf /was-ist-prompt-injection/ hereinfallen kann, aber nicht automatisch sensible Daten ausleitet. Sie ist zugleich enger als [/glossar/agent/]: Ein Agent kann nützlich und handlungsfähig sein, ohne alle drei Voraussetzungen zu vereinen.

Dokumentiertes Beispiel

Willison beschreibt einen Angriff auf einen GitHub-MCP-Server als Beispiel für die vollständige Kombination: Öffentliche Issues konnten fremden Inhalt enthalten, private Repositorien lieferten vertrauliche Daten, und die Erstellung eines Pull Requests bot einen möglichen Ausgangskanal.1 Entscheidend an diesem Fall ist nicht ein bestimmter Textinhalt, sondern die Kopplung von Vertrauensgrenzen und Befugnissen in einem Werkzeugkontext. Forschungsumgebungen wie AgentDojo modellieren denselben Grundkonflikt systematisch: Agenten führen Werkzeuge über nicht vertrauenswürdige Daten aus, und Sicherheits- wie Nutzwertmetriken müssen gemeinsam betrachtet werden.2 Damit wird die Trias von einer einprägsamen Formel zu einer prüfbaren Frage an eine konkrete Werkzeugliste.

Bedeutung für die Abwehr

Die stärkste Entwurfsregel lautet nicht, jede Injektion erkennen zu wollen, sondern mindestens eine Zutat bewusst zu entfernen oder eng zu begrenzen. Für einen Leseservice kann das heißen, keine ausgehenden Netz- oder Versandfunktionen bereitzustellen; für einen Kommunikationsagenten, private Datenquellen auszuklammern; für einen Datenagenten, fremde Inhalte in eine getrennte Verarbeitung zu geben. OWASP empfiehlt passend dazu minimale Erweiterungen, enge Berechtigungen, keine offenen Allzweckwerkzeuge und Bestätigung bei folgenreichen Handlungen.3 /glossar/least-privilege/ reduziert damit nicht nur die Folgen eines Fehlers, sondern kann die Trias strukturell aufbrechen. Ein Filter oder eine Modellhärtung bleibt sinnvoll, ist aber kein Ersatz für diese Entscheidung über Datenquellen und Ausgabekanäle.

Quellen

  1. Simon Willison, „The lethal trifecta for AI agents: private data, untrusted content, and external communication“, 16. Juni 2025, https://simonwillison.net/2025/Jun/16/the-lethal-trifecta/
  2. Edoardo Debenedetti et al., „AgentDojo: A Dynamic Environment to Evaluate Prompt Injection Attacks and Defenses for LLM Agents“, 24. November 2024, https://arxiv.org/abs/2406.13352
  3. OWASP Gen AI Security Project, „LLM03:2026 Excessive Agency“, 3. August 2026, https://genai.owasp.org/resource/owasp-genai-llm-top-10-2026/