CaMeL
CaMeL ist eine Agentenarchitektur, die aus einer vertrauenswürdigen Anfrage Kontroll- und Datenflüsse ableitet und Werkzeugaufrufe gegen eine durchsetzbare Policy prüft. Nicht vertrauenswürdige, später abgerufene Inhalte sollen dadurch den Programmfluss nicht verändern können; Capabilities begrenzen zudem Datenflüsse zu Werkzeugen.1 CaMeL ist folglich eine Systemschicht um ein weiterhin potenziell injizierbares Sprachmodell, keine Behauptung, das Basismodell selbst verstehe Vertrauen zuverlässig.
Einordnung
Der Ansatz verschiebt die relevante Sicherheitsentscheidung aus dem Prompt in deterministisch prüfbare Regeln. Eine Benutzeranfrage legt fest, welche Operationen, Datenbezüge und Zielkontexte zulässig sind; Inhalte aus Dokumenten, E-Mails oder Webquellen bleiben Daten und dürfen keine neue Kontrollentscheidung erzeugen. Damit präzisiert CaMeL die Richtung des /glossar/dual-llm-muster/: Nicht lediglich zwei Modellrollen werden getrennt, sondern die Ausführung erhält eine explizite Policy- und Capability-Ebene. Die Sicherheitsbehauptung gilt daher innerhalb des formalisierten Bedrohungs- und Policy-Modells. Sie bedeutet nicht, dass jeder vom Modell erzeugte Text korrekt ist, oder dass eine zu weit gefasste ursprüngliche Nutzeranfrage nachträglich harmlos wird.1
Dokumentiertes Beispiel
Die Autoren evaluieren CaMeL im AgentDojo-Umfeld, das Werkzeugagenten mit nicht vertrauenswürdigen Daten testet. In der berichteten Evaluation löste CaMeL 77 Prozent der Aufgaben mit nachweisbarer Sicherheit; ein ungeschütztes System erreichte 84 Prozent. Der Abstand beschreibt den Preis der Beschränkung in diesem Aufgabenbestand.1 AgentDojo selbst umfasst 97 realitätsnahe Aufgaben und 629 Sicherheitsfälle und dokumentiert damit, weshalb reine Erfolgsraten ohne Sicherheitsmaß wenig aussagekräftig sind.2 Ein typischer CaMeL-Fall ist eine angefragte Kommunikation: Eine Zieladresse, die erst in einem fremden Dokument erscheint, wird nicht automatisch zur neuen zulässigen Senke, wenn die aus der Anfrage abgeleitete Policy sie nicht erlaubt.
Bedeutung für die Abwehr
CaMeL ist besonders relevant, wenn /glossar/agent/ private Daten verarbeitet und zugleich Werkzeuge mit Außenwirkung besitzt. Es zeigt, dass Prompt-Injection-Abwehr als Informationsfluss- und Berechtigungsproblem modellierbar ist. Praktisch setzt das eine präzise Policy-Sprache, eine vertrauenswürdige Laufzeitdurchsetzung und sauber geschnittene Werkzeuge voraus; jede unsaubere Freigabe erweitert die zulässigen Flüsse. Aufgaben, deren Ablauf sinnvoll erst aus fremden Inhalten entstehen soll, stehen im Spannungsverhältnis zur Garantie. Betreiber sollten deshalb nicht nach einem pauschalen „CaMeL-sicher“ fragen, sondern nach der konkreten Policy, den geschützten Nebenwirkungen und den ausgeschlossenen Aufgabenklassen. Die Architektur ergänzt Modellhärtung, ersetzt aber weder brauchbare Identitäts- und Rechteverwaltung noch eine fachliche Prüfung kritischer Transaktionen.
Quellen
- Edoardo Debenedetti et al., „Defeating Prompt Injections by Design“, 24. Juni 2025, https://arxiv.org/abs/2503.18813 ↩
- Edoardo Debenedetti et al., „AgentDojo: A Dynamic Environment to Evaluate Prompt Injection Attacks and Defenses for LLM Agents“, 24. November 2024, https://arxiv.org/abs/2406.13352 ↩