Verwirrter Stellvertreter (Confused Deputy)
Ein verwirrter Stellvertreter ist eine privilegierte Komponente, die ihre legitime Autorität für eine Handlung einsetzt, zu der der eigentliche Veranlasser nicht befugt wäre. Das klassische Problem entsteht, wenn die Komponente unterschiedliche Autoritätsquellen nicht sauber zuordnen und begrenzen kann.1 Bei KI-Agenten kann eine indirekte Prompt Injection die fremde Veranlassung liefern, während der Agent mit Nutzer- oder Systemrechten handelt.
Einordnung
Der Begriff stammt aus der Zugriffskontrollforschung und ist nicht mit einem Modellfehler gleichzusetzen. Ein Agent kann einen Text korrekt wiedergeben und dennoch zum Confused Deputy werden, wenn dieser Text die Auswahl eines Werkzeugs, eines Objekts oder eines Zielsystems beeinflusst. OWASP beschreibt die moderne Risikokategorie als „Excessive Agency“: Schädliche Handlungen können durch unerwartete, mehrdeutige oder manipulierte Modellausgaben entstehen; indirekte Prompt Injection ist ausdrücklich ein möglicher Auslöser.2 Die Nachbarbegriffe /glossar/agent/ und /glossar/werkzeugnutzung/ bezeichnen dagegen Fähigkeit und Schnittstelle, nicht die konkrete Fehlzuordnung von Autorität.
Dokumentiertes Beispiel
Norm Hardys Originalaufsatz schildert einen Compiler, der mit einer besonderen Berechtigung in sein eigenes Verzeichnis schreiben darf und zugleich im Auftrag eines Aufrufers eine Ausgabedatei erzeugt. Weil der Compiler die Herkunft und den Zweck seiner Autorität nicht ausdrücken konnte, konnte ein vom Aufrufer bestimmter Dateiname die privilegierte Berechtigung für eine unpassende Schreiboperation ausnutzen.1 Übertragen auf einen Agenten ist die Sicherheitsfrage dieselbe: Eine in einem gelesenen Dokument genannte Ticketkennung, Adresse oder Ressource darf nicht schon deshalb zum Handlungsziel werden, weil das Modell sie als plausibel ausgibt. AgentDojo dokumentiert die Relevanz dieser Brücke für Tool-Agenten über nicht vertrauenswürdigen Daten.3
Bedeutung für die Abwehr
Die Gegenmaßnahme lautet nicht „dem Modell besser erklären, wessen Interesse gilt“, sondern Autorität technisch zu binden. Werkzeuge sollen nur die minimale Funktion und Berechtigung erhalten; Downstream-Systeme müssen jeden Aufruf selbst gegen eine Policy prüfen. OWASP empfiehlt insbesondere Ausführung im Kontext des jeweiligen Nutzers, minimale Rechte, menschliche Freigabe für folgenschwere Aktionen und vollständige Vermittlung statt einer Autorisierungsentscheidung durch das Modell.2 Capabilities mit enger Reichweite sind dafür geeigneter als weitreichende, implizite Zugangsdaten. In einem solchen Entwurf kann ein Agent fremden Text verarbeiten, ohne dass dieser automatisch in die Autorität des Nutzers oder Dienstes übersetzt wird. Das vermindert die Auswirkung einer erfolgreichen Injektion, auch wenn deren Erkennung unvollständig bleibt.
Quellen
- Norman Hardy, „The Confused Deputy: (or why capabilities might have been invented)“, 1. Oktober 1988, https://dl.acm.org/doi/10.1145/54289.871709 ↩
- OWASP Gen AI Security Project, „LLM03:2026 Excessive Agency“, 3. August 2026, https://genai.owasp.org/resource/owasp-genai-llm-top-10-2026/ ↩
- Edoardo Debenedetti et al., „AgentDojo: A Dynamic Environment to Evaluate Prompt Injection Attacks and Defenses for LLM Agents“, 24. November 2024, https://arxiv.org/abs/2406.13352 ↩