prompt injections.de
Werkzeug

AgentDojo

AgentDojo ist eine quelloffene, dynamische Evaluationsumgebung für Prompt-Injection-Angriffe und Abwehrmaßnahmen in werkzeugnutzenden LLM-Agenten. Entwickelt wurde der Benchmark von Forschenden der ETH Zürich; mehrere Autoren sind zugleich bei Invariant Labs affiliiert.1 Sein Ansatz setzt nicht bei einem einzelnen Eingabetext an, sondern bei einem Agenten, der Aufgaben mit simulierten Werkzeugen über potenziell nicht vertrauenswürdige Daten erledigt. Damit ist AgentDojo ein Messwerkzeug für Prompt Injection und kein vorgeschalteter Produktiv-Guardrail.

Funktionsweise

Im Kern modelliert AgentDojo vollständige Hijacking-Szenarien: Ein Agent soll eine legitime Aufgabe lösen, verarbeitet dabei Werkzeugausgaben oder externe Inhalte und trifft auf eine Injektion, die sein Verhalten umleiten soll.2 Der veröffentlichte NeurIPS-Beitrag beschreibt 97 realitätsnahe Aufgaben und 629 Sicherheits-Testfälle. Anders als ein unveränderlicher Testsatz ist die Umgebung darauf angelegt, Aufgaben, Abwehrmechanismen und adaptive Angriffe zu ergänzen.2 In der Referenzumgebung werden Nutzen und Sicherheit deshalb gemeinsam betrachtet: Ein System, das die Injektion nicht befolgt, die legitime Aufgabe aber ebenfalls nicht erledigt, ist nicht ohne Weiteres eine brauchbare Abwehr.2

Die Dokumentation strukturiert die Erweiterung entlang einer Agenten-Pipeline. Eigene Modelle, Abwehrlogiken, Angriffe und Task-Suites lassen sich an den vorgesehenen Schnittstellen ergänzen; die Ausführung erfolgt über ein Benchmark-Skript mit Parametern für Suite, Nutzeraufgabe, Modell, Abwehr und Angriff.3 Die Plattform dokumentiert außerdem einen optionalen Prompt-Injection-Detektor, der als zusätzliches Python-Extra installiert wird.3 Für die Bewertung eigener Gegenmaßnahmen ist diese Modularität nützlich, weil sie Vergleiche gegen dieselben Szenarien ermöglicht, ersetzt aber weder eine Bedrohungsmodellierung noch mehrschichtige Schutzmaßnahmen im Betrieb.

Einsatz in der Praxis

Der Bezug erfolgt als Python-Paket; für einen reproduzierbaren Lauf werden Modellzugang, konkret gewählte Suite, Aufgaben, Abwehr- und Angriffsparameter festgehalten.3 Der aktuell veröffentlichte Release ist v0.1.35 vom 27. Oktober 2025. Das Repository war zum Stichtag 20. August 2026 weiterhin öffentlich, nicht archiviert und zeigte einen neueren Main-Branch-Push vom 2. Juni 2026; Release und Entwicklungsstand sind also auseinanderzuhalten.4 Für interne Evaluierungen empfiehlt sich daher, zusätzlich zur Paketversion den konkreten Commit und die verwendeten Modellversionen zu protokollieren.

Eine wichtige externe Einordnung liefert NIST: Das Center for AI Standards and Innovation nutzte AgentDojo für Untersuchungen zu Agent-Hijacking, übernahm Defaultszenarien und ergänzte eigene Fälle sowie technische Verbesserungen.5 NIST hebt daraus hervor, dass gemeinsame Evaluationsrahmen kontinuierlich erweitert, Angriffe adaptiv getestet und Aufgaben getrennt ausgewertet werden sollten.5 Das ist kein Zertifikat für eine umfassende Abdeckung; vielmehr unterstreicht es, dass Benchmarkwerte nur für die getesteten Szenarien und Versuchseinstellungen gelten. Organisationen können AgentDojo daher als wiederholbaren Baustein neben Reviews, Logging und produktionsnahen Tests einsetzen, ähnlich wie andere Sicherheits-Benchmarks.

Grenzen

Die Autoren berichten ausdrücklich, dass aktuelle LLMs viele Aufgaben schon ohne Angriff nicht zuverlässig lösen und die untersuchten Angriffe nicht jede Sicherheitseigenschaft verletzen.2 Ein niedriger Angriffs-Erfolg kann deshalb aus tatsächlicher Robustheit, eingeschränkter Agenten-Nützlichkeit oder einer unpassenden Aufgabenabdeckung resultieren. Auch NISTs Erweiterungen der Standardszenarien zeigen, dass neue Risiken oder neue Angriffsmethoden außerhalb der Ausgangssuite liegen können.5 Hinzu kommt ein praktischer Vorbehalt der eigenen Dokumentation: Die Paket-API befinde sich noch in Entwicklung und könne sich ändern.3

Lizenz und Bezug

AgentDojo steht unter der MIT License; für den Quellcode und das Paket ist kein Hersteller-Preismodell ausgewiesen.4 Kosten können dennoch durch die jeweils angebundenen Modell- oder Infrastrukturangebote entstehen, denn der Benchmark selbst liefert keine LLM-Inferenz mit. In den für diesen Beitrag geprüften Primärquellen findet sich keine Übernahme- oder Einstellungsmitteilung zum Projekt; der sichtbare Repository-Status ist aktiv und nicht archiviert.4

Quellen

  1. AgentDojo-Dokumentation, „AgentDojo: A Dynamic Environment to Evaluate Prompt Injection Attacks and Defenses for LLM Agents“, Stand 20. August 2026, https://agentdojo.spylab.ai/.
  2. Debenedetti et al., „AgentDojo: A Dynamic Environment to Evaluate Prompt Injection Attacks and Defenses for LLM Agents“, NeurIPS 2024, https://proceedings.neurips.cc/paper_files/paper/2024/hash/97091a5177d8dc64b1da8bf3e1f6fb54-Abstract-Datasets_and_Benchmarks_Track.html.
  3. ETH Zürich SPY Lab, „AgentDojo README“, Stand 20. August 2026, https://raw.githubusercontent.com/ethz-spylab/agentdojo/main/README.md.
  4. GitHub, „ethz-spylab/agentdojo – Releases und Repository-Metadaten“, Abruf 20. August 2026, https://github.com/ethz-spylab/agentdojo und https://api.github.com/repos/ethz-spylab/agentdojo.
  5. NIST Center for AI Standards and Innovation, „Technical Blog: Strengthening AI Agent Hijacking Evaluations“, 17. Januar 2025, https://www.nist.gov/news-events/news/2025/01/technical-blog-strengthening-ai-agent-hijacking-evaluations.