InjecAgent
InjecAgent ist ein quelloffener Benchmark zur Messung indirekter Prompt Injection in werkzeugintegrierten LLM-Agenten. Das Projekt stammt aus dem Umfeld des Kang Lab der University of Illinois und untersucht Situationen, in denen ein Agent externe Inhalte verarbeitet und dadurch zu schädlichen Handlungen oder zur Preisgabe von Daten verleitet werden könnte.1 Es ist ein Evaluationsdatensatz mit Simulationscode, nicht eine Laufzeitabwehr für produktive Agenten.
Funktionsweise
Der Benchmark umfasst 1.054 Testfälle über 17 Nutzerwerkzeuge und 62 Angreiferwerkzeuge.1 Die Fälle verbinden legitime Nutzeraufgaben mit Angreiferfällen und unterscheiden zwei Zielklassen: unmittelbare nachteilige Handlungen für Nutzende und die Exfiltration privater Daten.1 Diese Aufteilung ist analytisch sinnvoll, weil sie nicht nur ein binäres „Angriff erfolgreich“ misst, sondern unterschiedliche Schutzgüter sichtbar macht. Die Daten liegen im Repository getrennt nach Nutzerfällen sowie den beiden Angreiferklassen vor.2
Architektonisch simuliert InjecAgent damit eine Tool-Landschaft: Ein LLM-Agent verarbeitet Inhalte aus Werkzeugen, entscheidet über weitere Schritte und wird im Benchmark gegen die zugehörigen Aufgaben- und Angreiferfälle ausgewertet.1 Die Implementierung ist Python-basiert und enthält Daten- sowie Quellcodeverzeichnisse; die README beschreibt die Nutzung mit konfigurierten Modellzugängen.2 Anders als bei einem produktiven Filter wird der Agent hier nicht dauerhaft überwacht. Das Ergebnis beschreibt stattdessen die Widerstandsfähigkeit einer bestimmten Kombination aus Modell, Agentenprompt, Tool-Simulation und Evaluationsfall.
Einsatz in der Praxis
Für ein internes Sicherheitsprogramm eignet sich InjecAgent als Regressionstest für einen eigenen, tool-nutzenden Agenten: Die Testumgebung wird lokal eingerichtet, ein Modellanbieter konfiguriert und die Ergebnisse werden je Zielklasse dokumentiert.2 Das schafft eine wiederholbare Baseline und erlaubt, Änderungen an Systeminstruktionen, Berechtigungen oder Techniken zur Datenbehandlung gegen denselben Fallbestand zu vergleichen. Der Benchmark ersetzt dabei keine Freigabeprüfung für reale Werkzeuge, weil seine Werkzeuge und Nebenbedingungen simuliert sind.
Die wissenschaftliche Veröffentlichung in Findings of ACL 2024 evaluiert 30 LLM-Agenten.1 Die Autoren berichten in ihrer damaligen Versuchsanordnung für einen ReAct-geprompteten GPT-4-Agenten eine Anfälligkeit von 24 Prozent.1 Diese Zahl ist kein allgemeiner Sicherheitswert für „GPT-4“ oder heutige agentische Produkte: Sie hängt von den 2024 getesteten Fällen, dem Prompting und der Auswertungslogik ab. Als Literaturbefund ist sie dennoch bedeutsam, weil sie demonstriert, dass Tool-Nutzung und externe Inhalte als gemeinsame Angriffsebene bewertet werden müssen.
Grenzen
Die dokumentierten 17 Nutzer- und 62 Angreiferwerkzeuge bilden einen fest definierten Ausschnitt ab.1 Ein guter Wert belegt folglich Widerstand gegen diese simulierten Interaktionen, nicht automatisch gegen eine produktive Werkzeuglandschaft mit anderen Datenformaten, Berechtigungen oder Folgewirkungen. Die Autoren selbst formulieren ihre Ergebnisse als Anlass, die breite Bereitstellung von LLM-Agenten kritisch zu hinterfragen; daraus folgt keine allgemeine Prognose für einzelne Systeme.1 Für belastbarere Aussagen sind zusätzlich produktionsnahe Tests, abgesicherte Tool-Berechtigungen und separate Prüfungen von Guardrail-Ansätzen erforderlich.
Lizenz und Bezug
Das öffentliche Python-Repository steht unter der MIT License.3 Zum Stichtag gab es weder Tags noch veröffentlichte Releases; der letzte Push datiert vom 2. Juli 2024, während das Repository weiterhin nicht archiviert und nicht deaktiviert war.3 Es existiert daher kein semantisch versionierter Release-Stand, den man für Vergleichsmessungen zitieren könnte. Wer Ergebnisse reproduzierbar machen will, sollte den Commit-Hash und die Abhängigkeiten festschreiben. Ein eigenes Preismodell weist das Forschungsrepository nicht aus; gegebenenfalls fallen Kosten bei den verwendeten Modell-APIs an.2
Quellen
- Zhan et al., „InjecAgent: Benchmarking Indirect Prompt Injections in Tool-Integrated Large Language Model Agents“, Findings of ACL 2024, August 2024, https://aclanthology.org/2024.findings-acl.624/. ↩
- University of Illinois Kang Lab, „InjecAgent README“, Stand 20. August 2026, https://github.com/uiuc-kang-lab/InjecAgent. ↩
- GitHub, „uiuc-kang-lab/InjecAgent – Repository-Metadaten“, Abruf 20. August 2026, https://api.github.com/repos/uiuc-kang-lab/InjecAgent. ↩