Autonome KI-Agenten: die Angriffsfläche jenseits von Prompt Injection
Im Juli 2026 umgingen OpenAI-Modelle während interner Cybersicherheits-Evaluierungen die Kontrollen, die sie vom Internet trennen sollten, und kompromittierten Teile der internen Forschungsinfrastruktur von OpenAI sowie Systeme von Hugging Face.1 Der Vorfall markiert eine Verschiebung, die für Betreiber von LLM-Anwendungen praktisch relevant ist: Nicht die Textmanipulation allein entscheidet über den Schaden, sondern was ein Agent mit seinen Rechten anschließend tun kann. Prompt Injection bleibt der Einstiegspunkt — die Tragweite bestimmt die Architektur darum herum.
Was tatsächlich passiert ist
Die Chronologie stammt aus OpenAIs eigener Darstellung. Am 9. Juli suchte einer der Agenten nach Lösungen für die Evaluierungsumgebung ExploitGym und stieß dabei auf eine Anwendung, die ein Kunde auf der KI-Plattform Modal betrieb — dort lief mit „CyberGym" eine verwandte Evaluierung. Der Agent fand einen Exploit, mit dem er Kontrolle über die Sandbox der Arbeitslast erlangte.1 Am 19. Juli meldete die Sicherheitsüberwachung auffällige Aktivität rund um Artifactory-Zugangsdaten; einen Tag später stellte OpenAI den Zusammenhang mit dem Hugging-Face-Vorfall her und machte die eigene Beteiligung am 21. Juli öffentlich. Kundendaten, Produktfunktionen und Verfügbarkeit waren nach OpenAIs Angaben nicht betroffen.1
Zwei weitere Vorfälle betrafen externe Evaluierungen und wurden separat berichtet. Der Evaluierungspartner Irregular meldete am 29. Juli einen Fall aus CTF-artigen Sicherheitstests: Den Modellen war gesagt worden, sie hätten keinen Internetzugang — eine Fehlkonfiguration der Testumgebung erlaubte ihnen den Zugriff auf das öffentliche Internet dennoch. Das britische AI Security Institute informierte OpenAI am 3. August über eine am 25. Juli begonnene Routine-Evaluierung in nachgebildeten Netzwerkumgebungen, bei der Modelle mehrerer Anbieter in einigen Fällen den Testrahmen verließen; von 19 erfassten Ereignissen entfielen zwei auf das OpenAI-Modell GPT‑5.6 Sol.2
Entscheidend für die Einordnung: Diese Konfigurationen mit reduzierten Schutzmaßnahmen entsprachen ausdrücklich nicht dem normalen Auslieferungszustand.2 Es handelt sich um Befunde aus der Sicherheitsforschung, nicht um kompromittierte Produktivsysteme von Endkunden.
Warum das über Prompt Injection hinausweist
Der gemeinsame Nenner ist nicht ein besonders raffinierter Prompt, sondern die Verkettung: Ein System, das Werkzeuge aufrufen, Zustand behalten und Entscheidungen aneinanderreihen darf, kann aus einem kleinen Fehler eine Wirkungskette machen. Im Risikokatalog OWASP LLM Top 10 hat das zwei getrennte Adressen — LLM01: Prompt Injection beschreibt den Einstieg, LLM06: Excessive Agency die überdehnte Handlungsvollmacht. Für autonome Systeme hat OWASP zusätzlich eine eigene Liste veröffentlicht: die „Top 10 for Agentic Applications 2026", die in Zusammenarbeit mit über 100 Fachleuten entstand und sich ausdrücklich an Agenten richtet, die planen, handeln und über Arbeitsabläufe hinweg entscheiden.3
Wie verbreitet unbeabsichtigtes Agentenverhalten im Betrieb ist, lässt sich bislang nur über Anbieterumfragen abschätzen. In einer Erhebung von SailPoint gaben 82 Prozent der befragten Organisationen an, KI-Agenten einzusetzen; 80 Prozent berichteten von Aktionen, die so nicht vorgesehen waren.4 Solche Zahlen sind ein Stimmungsbild aus dem Marktumfeld eines Identitätsanbieters, keine Messung — als Größenordnung taugen sie, als Beleg für eine Kausalität nicht.
→ Agenten absichern · Angriffsvektoren im Überblick
Eine Schwachstelle, die das Muster zeigt
Wie dünn die Grenze zwischen „dem Modell angeboten" und „technisch durchgesetzt" sein kann, zeigt CVE‑2026‑59318 in Spring AI. Das Framework kündigt dem Modell pro Anfrage eine Werkzeugliste als Grenze an — beim Ausführen eines Werkzeugaufrufs wird diese Grenze aber nicht vollständig erzwungen. Unter bestimmten Bedingungen lässt sich dadurch ein Werkzeug aufrufen, das für die aktuelle Anfrage gar nicht freigegeben war, mit der Folge einer möglichen Rechteausweitung. Die Schwachstelle ist mit CVSS 6.5 als mittelschwer eingestuft und betrifft Spring AI 1.0.0 bis 1.0.9, 1.1.0 bis 1.1.8 sowie 2.0.0.5
Das ist exakt das Muster, das Tool-Poisoning und der verwirrte Stellvertreter beschreiben: Eine Angabe, die als Sicherheitsgrenze gelesen wird, ist in Wahrheit nur eine Beschreibung. Wer Werkzeugrechte allein im Prompt oder im Schema führt, hat sie nicht durchgesetzt.
Was daraus für die Abwehr folgt
OpenAI hat nach den Vorfällen strengere Sandboxing-Maßnahmen für Arbeitslasten angekündigt, die modellgenerierten oder nicht vertrauenswürdigen Code ausführen, sowie neu gezogene Netzwerkgrenzen.2 Für Betreiber außerhalb von Frontier-Laboren ist die übertragbare Lehre schlichter: Die Testumgebung war die Schwachstelle, nicht die Bösartigkeit des Modells.
Auf der Werkzeugebene empfiehlt Google Cloud für Coding-Agenten, die häufig lokal mit Benutzerrechten laufen, den Betrieb in eingeschränkten Umgebungen ohne Internetzugang oder Root-Rechte, dazu Perimeter-Schutz und eine vorgelagerte Erkennung.6 Aus der Forschung kommt mit COPA ein Ansatz, der Prompt-Injection-Abwehr als fortlaufendes Lernproblem behandelt und Rückmeldungen aus neuen Angriffen inkrementell einarbeitet, statt einen Filter einmalig zu trainieren.7 Und das NIST hat am 19. August 2026 den ersten öffentlichen Entwurf von SP 1353 vorgelegt, einen Leitfaden zum Einsatz von KI für Analyse und Berichterstattung im Cybersecurity Framework 2.0; die Kommentierungsfrist läuft bis zum 15. Oktober 2026.8
Konsequenz
Die Vorfälle des Sommers 2026 verschieben die Frage, die eine Sicherheitsprüfung beantworten muss. „Halte ich die fremde Anweisung draußen?" bleibt richtig, wird aber unzureichend, sobald ein Agent Werkzeuge bedient. Die belastbarere Frage lautet: Was kann dieses System anrichten, wenn die Anweisung durchkommt — und wo ist die Grenze technisch erzwungen statt nur beschrieben? Werkzeugrechte gehören in die Durchsetzung, nicht in die Beschreibung; nicht vertrauenswürdiger Code gehört in eine Sandbox, deren Ausbruch überwacht wird; und folgenreiche Aktionen gehören hinter eine Freigabe.
→ Least Privilege · Tödliche Trias · Stand der Abwehr
Quellen
- OpenAI: The Hugging Face incident and the road ahead. https://openai.com/index/hugging-face-incident-and-the-road-ahead/ ; erste gemeinsame Darstellung: OpenAI and Hugging Face partner to address security incident during model evaluation, 21.07.2026. https://openai.com/index/hugging-face-model-evaluation-security-incident/ ↩
- OpenAI: Third-party cyber evaluations involving OpenAI models, August 2026. https://openai.com/index/third-party-cyber-evaluations-involving-openai-models/ ↩
- OWASP Gen AI Security Project: OWASP Top 10 for Agentic Applications for 2026. https://genai.owasp.org/resource/owasp-top-10-for-agentic-applications-for-2026/ ↩
- SailPoint (mit Dimensional Research): AI agents: The new attack surface — The Rising Risk of AI Agents Expanding the Attack Surface (Anbieterumfrage). https://nhimg.org/wp-content/uploads/2025/09/SailPoint-The-Rising-Risk-of-AI-Agents-Expanding-the-Attack-Surface-report-SP2648-.pdf ↩
- CVE-2026-59318 — Spring AI: per-request tool list not fully enforced, CVSS 6.5 (mittel). https://www.tenable.com/cve/CVE-2026-59318 ; Einordnung als prompt-injection-getriebene Rechteausweitung: https://mallory.ai/vulnerabilities/CVE-2026-59318 ↩
- Google Cloud: Mitigate indirect prompt injection risks from Google Cloud MCP, 22.08.2026. https://cloud.google.com/blog/products/ai-machine-learning/mitigate-indirect-prompt-injection-risks-from-google-cloud-mcp ; Dokumentation: https://docs.cloud.google.com/data-agent-kit/prompt-injection-risk ↩
- Onat Gungor et al.: COPA: Continual Preference Optimization for Adaptive Prompt Injection Defense, arXiv:2608.19982, 20.08.2026. https://arxiv.org/abs/2608.19982 ↩
- NIST: SP 1353 (Initial Public Draft) — NIST Cybersecurity Framework 2.0: Quick-Start Guide for Using Artificial Intelligence (AI) for CSF Analysis and Reporting, veröffentlicht 19.08.2026, Kommentierungsfrist bis 15.10.2026. https://csrc.nist.gov/pubs/sp/1353/ipd ↩