Benchmark
Ein Sicherheits-Benchmark ist ein festgelegtes Verfahren, das ein System gegen definierte Aufgaben, Angriffsversuche und Bewertungskriterien misst. Für LLM-Agenten verbindet er typischerweise zwei Größen: den Nutzen bei legitimen Aufgaben und die Widerstandsfähigkeit gegen Sicherheitsverletzungen. Ein Benchmark-Wert ist daher ein Befund für einen abgegrenzten Testsatz, keine allgemeine Eigenschaft des Systems.1
Einordnung
Bei Prompt Injection ist der Unterschied zwischen Test und Sicherheitszusage besonders wichtig. Ein System kann auf bekannten, sauber kuratierten Fällen gut abschneiden und dennoch an einer neuen Datenquelle, Sprache, Modalität oder Tool-Kombination scheitern. Ebenso kann eine harte Abwehr den Angriffsanteil senken, aber den legitimen Aufgabenerfolg unvertretbar verschlechtern. Gute Benchmarks machen diesen Zielkonflikt sichtbar, statt nur eine Angriffsrate zu veröffentlichen.
AgentDojo ist dafür ein anschaulicher Ansatz: Die NeurIPS-Arbeit beschreibt eine erweiterbare Umgebung für Agenten, die Werkzeuge über unzuverlässige Daten nutzen. Der veröffentlichte Bestand umfasst 97 realitätsnahe Aufgaben und 629 Sicherheitstestfälle; bewertet werden Angriffsmuster und Schutzansätze im selben Umfeld.1 Im Gegensatz zu einem statischen Promptkatalog können Aufgaben, Datenquellen und adaptive Varianten erweitert werden. Trotzdem modelliert jede Umgebung nur einen Teil späterer Produktionsbedingungen; Evaluierung ersetzt daher weder Bedrohungsmodell noch kontinuierliches Red Teaming.
Dokumentiertes Beispiel
InjecAgent untersucht indirekte Prompt Injection bei werkzeugintegrierten LLM-Agenten. Die veröffentlichte Fassung enthält 1.054 Testfälle mit 17 Nutzer- und 62 Angreiferwerkzeugen und unterscheidet unter anderem direkte Schädigung von Datenabfluss.2 Die Autoren berichten für die geprüften Agenten Verwundbarkeiten; die Zahlen sind jedoch an ihre Aufgaben, Agentenkonfigurationen und Bewertungsdefinitionen gebunden. Der dokumentierte Fall zeigt, warum eine einzelne Erfolgsquote ohne Modellversion, Tool-Set, Testsatz und Angriffsdefinition redaktionell nicht aussagekräftig ist.
Bedeutung für die Abwehr
Der produktive Nutzen eines Benchmarks liegt vor allem im Regressionstest. Derselbe versionierte Testsatz sollte vor und nach Modellwechseln, Änderungen am Systemprompt, neuen Konnektoren oder veränderten Tool-Rechten laufen. Wichtig sind getrennte Kennzahlen für legitimen Aufgabenerfolg, blockierte Angriffe, übersehene Angriffe und fälschlich blockierte Nutzereingaben. Treffer aus dem Betrieb gehören als kontrolliert dokumentierte neue Fälle in eine interne Testsuite, ohne fremde Nutzdaten ungeschützt zu übernehmen. Ein Red-Teaming kann auf MITRE ATLAS aufbauen und dann die für die eigene Anwendung relevanten Techniken in testbare Fälle überführen. Der Benchmark wird so vom Marketingwert zum Frühwarninstrument für Veränderungen im Sicherheitsniveau.
Quellen
- Edoardo Debenedetti et al., „AgentDojo: A Dynamic Environment to Evaluate Prompt Injection Attacks and Defenses for LLM Agents“, 24. November 2024, https://arxiv.org/abs/2406.13352 ↩
- Qiusi Zhan et al., „InjecAgent: Benchmarking Indirect Prompt Injections in Tool-Integrated Large Language Model Agents“, 4. August 2024, https://arxiv.org/abs/2403.02691 ↩