o1 / o1-preview
OpenAI o1 und das frühere o1-preview gehören zur Reasoning-Familie des Anbieters. Die System Card zu o1 behandelt Sicherheitsfragen neben Leistung, darunter unerlaubte Inhalte, Halluzinationen, Bias, Cyberrisiken, CBRN, Überzeugung und Modellautonomie.1 Für Betreiber ist die Modellfamilie besonders relevant, weil ausführliches Reasoning keine eigenständige Sicherheitsgrenze darstellt, sondern in eine robuste Anwendung mit klaren Werkzeug- und Datenrechten eingebettet werden muss.
Einordnung
Die System Card beschreibt für o1 Sicherheitsprüfungen, externes Red Teaming und Evaluierungen nach dem Preparedness Framework.1 Sie unterscheidet damit sinnvoll zwischen Modellfähigkeit und dem Sicherheitsprozess vor einer Veröffentlichung. Diese Trennung sollte auch der Betrieb übernehmen: Ein reasoning-starkes Modell kann nützlicher bei der Aufgabenerfüllung sein, doch ein erfolgreicher Jailbreak betrifft die Durchsetzung von Grenzen, nicht die Qualität einer Argumentationskette.
Öffentlich gefundene, direkt vergleichbare Resultate aus AgentDojo oder Open-Prompt-Injection liegen für o1 beziehungsweise o1-preview in den geprüften Primärquellen nicht vor. Diese Lücke erlaubt keine Aussage, o1 sei bei indirekter Prompt Injection besser oder schlechter als konkurrierende Modelle. Sie unterstreicht vielmehr, dass Betreiber ihre konkrete Agentenumgebung mit eigenen Angriffsszenarien testen müssen.
Dokumentierte Schwächen
Cisco untersuchte o1-preview zusammen mit anderen Frontier-Modellen und DeepSeek R1 mit einem automatisierten Jailbreaking-Verfahren. Der Bericht nutzte 50 gleichmäßig aus HarmBench gezogene Prompts, Temperatur null, automatisierte Refusal-Erkennung und menschliche Aufsicht zur Verifikation.2 Cisco schreibt, o1-preview blockiere eine Mehrheit adversarieller Angriffe. Das ist ein positives, aber begrenztes Ergebnis: Eine Mehrheitsblockade ist kein vollständiger Schutz, und die kleine Stichprobe ist keine Schätzung für jede Aufgabe, Sprache oder Mehrturn-Interaktion.2
Die teils zitierte konkrete Blockrate von 74 Prozent ist im zugänglichen Text des Cisco-Berichts nicht direkt ausgewiesen. Diese Analyse verwendet deshalb bewusst nur die textlich belegte qualitative Aussage und vermeidet eine scheinpräzise Zahl.2 Zudem beziehen sich die Ergebnisse auf o1-preview, nicht automatisch auf alle späteren o1-Konfigurationen. Die Befundlage zeigt damit Resistenz gegen einen bestimmten Testaufbau, aber keine belastbare Immunität gegen neue oder kontextabhängige Angriffe.
Schutzmechanismen des Anbieters
OpenAI erläutert ein Monitoring der Chain of Thought als Forschungsansatz. In einer Fallstudie setzte der Anbieter einen GPT-4o-basierten Monitor ein, der auf einem kleinen internen Datensatz eine Genauigkeit von 92 Prozent erreichte; OpenAI warnt zugleich ausdrücklich, dass Gedankenspuren künftig oder bereits heute nicht vollständig lesbar und verlässlich sein könnten.1 Dieses Monitoring ist daher kein Sicherheitsversprechen, sondern ein zusätzliches Beobachtungsinstrument mit bekannten Grenzen.
Die System Card dokumentiert ferner externe Red-Teaming-Aktivitäten und breit angelegte Safety-Evaluierungen.1 Das sind relevante Anbietermaßnahmen, doch sie ersetzen keine anwendungsspezifische Zugriffskontrolle. Insbesondere bei Prompt Injection entscheidet die Umgebung, ob ein manipuliertes Modell überhaupt folgenreiche Daten lesen, Werkzeuge aufrufen oder Aktionen auslösen kann.
Bedeutung für Betreiber
o1 sollte wie jedes Modell mit begrenzten Rechten betrieben werden. Tool-Aufrufe benötigen eine serverseitige Policy-Prüfung; externe Inhalte dürfen keine versteckten Berechtigungen vermitteln; sensible Aktionen müssen eine unabhängige Zustimmung verlangen. Eine bloße Modellinstruktion, vertrauliche Daten nicht preiszugeben, reicht nicht aus, wenn das Modell selbst Zugriff auf zu viele Daten oder Funktionen besitzt.
Sinnvoll sind wiederholbare Mehrturn-Tests, die das eigene RAG-System, Anhänge, Postfächer und Werkzeuge abdecken. Dabei wird nicht die Offenlegung von Reasoning verlangt, sondern die beobachtbare Wirkung geprüft: Welche Daten wurden abgerufen, welche Werkzeuge wurden angefordert und welche Aktion wurde tatsächlich ausgeführt? Für den produktiven Betrieb sollte Schutz damit vor, während und nach dem Modellaufruf durchgesetzt werden.
Quellen
- OpenAI, „OpenAI o1 System Card“, 5. Dezember 2024, https://openai.com/index/openai-o1-system-card/ ↩
- Paul Kassianik und Amin Karbasi, Cisco, „Evaluating Security Risk in DeepSeek and Other Frontier Reasoning Models“, 31. Januar 2025, https://blogs.cisco.com/security/evaluating-security-risk-in-deepseek-and-other-frontier-reasoning-models ↩