prompt injections.de
Glossar

KI-Agent

Ein KI-Agent ist ein System, das ein Sprachmodell für textbasierte Aufgabeninterpretation mit externen Werkzeugaufrufen und einer mehrschrittigen Ausführungsschleife verbindet. In dieser Kombination kann das System Informationen abrufen, Zwischenergebnisse verarbeiten und Handlungen in angeschlossenen Systemen auslösen; die Schleife kann weitere Modellentscheidungen mit den Werkzeugergebnissen begründen.1 Erst diese Handlungsmacht macht aus einer fehlgeleiteten Modellinterpretation einen möglichen Vertraulichkeits-, Integritäts- oder Verfügbarkeitsvorfall.

Einordnung

Nicht jeder Chatbot ist ein Agent. Ein Modell, das ausschließlich Text ausgibt, besitzt noch keine direkte Fähigkeit, Kalender, Dateien, Datenbanken oder Kommunikationskanäle zu verändern. Ein Agent erhält diese Fähigkeit über /glossar/werkzeugnutzung/ und kann, abhängig vom Entwurf, mehrere Modell- und Werkzeugschritte verketten. OWASP beschreibt diese Form von Agency als Fähigkeit, Funktionen oder andere Systeme über Erweiterungen aufzurufen; die Auswahl der Erweiterung kann dem Modell überlassen sein.2 Prompt Injection ist deshalb für Agenten mehr als ein Qualitätsproblem: Nicht vertrauenswürdiger Inhalt kann die nächste Aktion beeinflussen, während der Agent in einem privilegierten Kontext weiterarbeitet.

Dokumentiertes Beispiel

AgentDojo untersucht genau diese Lage: Die Autoren definieren Agenten als Verbindung von textbasiertem Schlussfolgern und externen Tool Calls und untersuchen, wie Werkzeugdaten den Agenten durch Prompt Injection auf bösartige Aufgaben umleiten können. Das Framework enthält 97 realistische Aufgaben, darunter E-Mail-Verwaltung, Online-Banking-Navigation und Reisebuchungen, sowie 629 Sicherheitsfälle.1 Der Befund ist differenziert: Spitzenmodelle scheiterten auch ohne Angriff an vielen Aufgaben; geprüfte Injektionen verletzten einige, aber nicht alle Sicherheitseigenschaften.1 Das Beispiel belegt keine pauschale Unsicherheit jedes Agenten, sondern die Notwendigkeit, Aufgabenerfolg und Sicherheitsgarantien getrennt zu messen.

Bedeutung für die Abwehr

Die Sicherheitsarchitektur eines Agenten beginnt bei der Werkzeugliste und der Frage, in wessen Kontext jedes Werkzeug handelt. Rechtebegrenzung, getrennte Lese- und Schreibpfade, feste Zielmengen und eine Bestätigung vor folgenreichen Änderungen verringern die Folgen einer Fehlsteuerung. OWASP empfiehlt außerdem, offene Allzweckfunktionen zu vermeiden und Autorisierung in Downstream-Systemen durchzusetzen, statt sie dem Modell zu überlassen.2 Das ist besonders wichtig bei der /glossar/toedliche-trias/: Kombiniert ein Agent private Daten, fremde Inhalte und externe Kommunikation, entsteht ein klarer Datenabflussweg. Ein Agent sollte daher nicht als autonomer Entscheider über Berechtigungen verstanden werden, sondern als unsicherer Planer innerhalb einer überprüfbaren Policy und möglichst kleiner Capabilities.

Quellen

  1. Edoardo Debenedetti et al., „AgentDojo: A Dynamic Environment to Evaluate Prompt Injection Attacks and Defenses for LLM Agents“, 24. November 2024, https://arxiv.org/abs/2406.13352
  2. OWASP Gen AI Security Project, „LLM03:2026 Excessive Agency“, 3. August 2026, https://genai.owasp.org/resource/owasp-genai-llm-top-10-2026/