GPT-5
GPT-5 bezeichnet bei OpenAI ein einheitliches System aus schnellen und vertieften Reasoning-Modellen, einem Router zur Modellwahl und kleineren Varianten für verschiedene Einsatzfälle.1 Für Betreiber ist diese Systemperspektive relevant: Die Widerstandsfähigkeit entsteht nicht allein aus einem Modellgewicht, sondern aus dem Zusammenwirken von Modell, Konversation, Werkzeugen und umgebenden Kontrollen.1 GPT-5 ist daher kein belastbarer Ersatz für eine eigene Sicherheitsarchitektur gegen Prompt Injection.
Einordnung
Prompt Injection zielt darauf, eine LLM-integrierte Anwendung durch fremde Instruktionen oder Daten vom vorgesehenen Auftrag abzubringen.2 Bei agentischen Anwendungen ist dies besonders kritisch, weil ein Modell nicht nur Text ausgibt, sondern gegebenenfalls Informationen verarbeitet oder Werkzeuge ansteuert. AgentDojo misst genau solche Angriffs- und Verteidigungskonstellationen in dynamischen Agentenumgebungen; der ältere Open-Prompt-Injection-Ansatz bewertet dagegen LLM-integrierte Anwendungen anhand festgelegter Angriffe, Abwehrmaßnahmen und Aufgaben.2 3 Beide Benchmarks sind deshalb hilfreiche Referenzen für das Anwendungsdesign, aber keine universelle Kennzahl für die Sicherheit eines nackten GPT-5-Endpunkts.
In den für diese Einordnung geöffneten öffentlichen Benchmarkquellen findet sich kein direkt vergleichbarer AgentDojo- oder Open-Prompt-Injection-Wert für GPT-5.2 3 Ein pauschales Ranking gegenüber anderen Modellen wäre daher redaktionell nicht haltbar. Für Betreiber zählt vielmehr, ob der eigene AgentDojo-Test die konkrete Kombination aus Datenquellen, Werkzeugrechten, Systemanweisungen und Freigaben abbildet.
Dokumentierte Schwächen
NeuralTrust veröffentlichte am 8. August 2025 eine manuelle Fallstudie zu gpt-5-chat. Der Bericht beschreibt eine erfolgreiche qualitative Demonstration, bei der ein schädlicher Kontext über mehrere Gesprächsschritte und eine narrative Einbettung aufgebaut wurde; ausdrücklich getestet wurde nur ein repräsentatives Ziel zur Machbarkeitsprüfung.4 Daraus folgt kein quantitativer Erfolgsanteil und kein Nachweis, dass GPT-5 in jedem Mehrturn-Szenario umgehbar ist. Der Befund zeigt jedoch eine wichtige Klasse von Risiken: Sicherheitsentscheidungen, die vorwiegend auf einer einzelnen, offen schädlichen Anfrage beruhen, erfassen schrittweise Kontextverschiebungen nur unvollständig.4
Die Studie ist ein externer Red-Team-Bericht eines Sicherheitsanbieters, keine Peer-Review-Publikation und keine standardisierte Benchmarkauswertung.4 Ihre Aussagekraft liegt folglich im dokumentierten Einzelfall und in der mehrturnigen Angriffslogik, nicht in einer allgemeinen Robustheitsrate. Operative Prompt- oder Ausgabedetails gehören nicht in eine defensive Sicherheitsbewertung.
Schutzmechanismen des Anbieters
OpenAI beschreibt für alle GPT-5-Varianten ein Safety-Training mit „safe-completions“, das unerlaubte Inhalte verhindern soll.1 Für gpt-5-thinking aktiviert der Anbieter nach eigener Vorsorgeeinstufung im biologisch-chemischen Bereich zusätzliche Maßnahmen seines Preparedness Framework.1 Diese Angaben dokumentieren Anbietermechanismen, sind aber keine unabhängige Bestätigung vollständiger Jailbreak- oder Injection-Resistenz.
Bemerkenswert ist die Trennung zwischen Inhaltssicherheit und Anwendungssicherheit. Auch ein Modell, das eine Ausgabe ablehnt, kann in einem Agentensystem bereits untrusted Kontext verarbeitet oder eine Werkzeugentscheidung vorbereitet haben. Betreiber sollten deshalb die Schutzmaßnahmen am gesamten Ablauf prüfen, nicht ausschließlich am letzten Modelltext.
Bedeutung für Betreiber
Für GPT-5 empfiehlt sich eine mehrschichtige Architektur: Fremdinhalte werden als Daten markiert und nicht als gleichrangige Anweisungen behandelt; Werkzeugzugriffe erhalten nur die minimal erforderlichen Rechte; riskante Schritte benötigen unabhängige Freigaben. Gesprächsverläufe sollten als zusammenhängender Sicherheitskontext geprüft werden, weil der externe Befund gerade eine schrittweise Verschiebung über mehrere Turns beschreibt.4 Diese Kontrollen helfen auch dann, wenn ein einzelner Modellaufruf unauffällig erscheint.
Eine belastbare Abnahme kombiniert anwendungsspezifisches Red Teaming mit wiederholbaren Szenarien aus Open Prompt Injection. Entscheidend sind dabei nicht Marketingaussagen über „jailbreak-resistent“, sondern messbare Fehlhandlungen: unzulässige Tool-Aufrufe, Offenlegung geschützter Daten, Zielabweichung und Umgehung menschlicher Freigaben. GPT-5 kann solche Prüfungen unterstützen, ersetzt sie aber nicht.
Quellen
- OpenAI, „GPT-5 System Card“, 7. August 2025, https://openai.com/index/gpt-5-system-card/ ↩
- Yupei Liu et al., „Formalizing and Benchmarking Prompt Injection Attacks and Defenses“, USENIX Security 2024, https://www.usenix.org/conference/usenixsecurity24/presentation/liu-yupei ↩
- Edoardo Debenedetti et al., „AgentDojo: A Dynamic Environment to Evaluate Prompt Injection Attacks and Defenses for LLM Agents“, 2024, https://agentdojo.spylab.ai/ ↩
- Martí Jordà, NeuralTrust, „GPT-5 Jailbreak with Echo Chamber and Storytelling“, 8. August 2025, https://neuraltrust.ai/blog/gpt-5-jailbreak-with-echo-chamber-and-storytelling ↩