prompt injections.de
News · Analyse

Die Sandbox als Abflusskanal: Was drei September-Meldungen über den Betrieb von KI-Assistenten sagen

· Gökhan Köse

Check Point Research hat am 8. September 2026 einen verdeckten Kanal zwischen den Code-Ausführungsumgebungen verschiedener ChatGPT-Konten beschrieben. Im Proof of Concept holte ChatGPT Daten aus dem verbundenen Gmail-Konto eines Opfers und reichte sie an das Konto des Angreifers weiter, ohne dass die sichtbare Antwort etwas davon zeigte.1 Einen Tag später veröffentlichte Wiz eine Untersuchung zu LiteLLM, dem meistgenutzten offenen LLM-Gateway: Fast jede zehnte öffentlich erreichbare Instanz akzeptiert den Standard-Master-Key oder verlangt gar keine Anmeldung.2 Parallel dazu hat OpenAI mit dem Lockdown Mode eine Einstellung eingeführt, die genau den letzten Schritt solcher Angriffe erschweren soll: den Abfluss nach außen.3 Die drei Meldungen hängen enger zusammen, als es zunächst scheint. Alle drei handeln davon, dass die Prompt Injection selbst nur der Anfang ist und die eigentliche Frage lautet, wohin die Daten danach fließen können.

Schaubild: Zwei Code-Container verschiedener ChatGPT-Konten ohne Internet und ohne direkte Verbindung erreichen denselben internen Paketdienst, über den Daten vom Opfer zum Angreifer fließen.

Der Check-Point-Fund: ein Kanal, den niemand gebaut hat

ChatGPT führt Code in isolierten Containern aus. Diese Container dürfen nicht ins offene Internet und dürfen nicht miteinander sprechen, sonst könnten Daten eines Nutzers bei einem anderen landen. Check Point Research hat im Juni 2026 einen Weg gefunden, wie zwei Container unter verschiedenen Konten trotzdem Daten austauschen: Beide erreichten denselben internen Dienst, über den Software-Pakete ausgeliefert werden. Der ließ sich als gemeinsame Ablage zweckentfremden, ein „Shared Clipboard“ innerhalb der Sandbox.1

Der Angriff braucht eine Anweisung im Kontext des Opfers. Die kann laut Check Point über einen präparierten Prompt, eine geteilte ChatGPT-Konversation oder ein benutzerdefiniertes GPT hineingelangen. Danach genügt eine gewöhnliche Nachricht des Opfers: ChatGPT erledigt die sichtbare Aufgabe und führt nebenbei den Auftrag des Angreifers aus, mit allen Werkzeugen, Daten und verbundenen Apps, die die Sitzung des Opfers hat. Im Versuch waren das die E-Mails aus einem angebundenen Gmail-Konto. Denselben Weg hätte auch der Gesprächsverlauf oder eine hochgeladene Datei nehmen können.1

Zwei Punkte sind für die Einordnung wichtig. Erstens war der Kanal geschlossen, bevor Check Point den Bericht fertig hatte. OpenAI bestätigte den Forschern, dass die betreffende interne Instanz abgeschaltet wurde.1 Zweitens beschreibt Check Point kein neues Injection-Verfahren. Neu ist die Beobachtung, dass ein Modell innerhalb der Vertrauensgrenze sitzt: Es hat Zugangsdaten, führt Code aus und erreicht interne Dienste, und es lässt sich per Text steuern. Check Point nennt das einen „coerced insider“, einen genötigten Insider. Das ist dieselbe Figur, die dieses Portal als verwirrten Stellvertreter führt.

Lockdown Mode: OpenAI sichert das Ende der Kette

OpenAI hat für ChatGPT einen Lockdown Mode eingeführt. Die Dokumentation ist deutlich in dem, was er leistet und was nicht: Er soll „die letzte Stufe“ einer Datenexfiltration durch Prompt Injection verhindern, indem er ausgehende Netzwerkanfragen beschränkt. Web-Browsing läuft nur noch auf zwischengespeicherte Inhalte, Deep Research und Agent Mode sind aus, Canvas-Code darf nicht ins Netz, Dateien werden nicht mehr aus dem Web geladen, Bilder in Antworten werden eingeschränkt. Verbindungen zu externen Diensten und schreibende Aktionen von Konnektoren werden für Einzelkonten blockiert, in verwalteten Arbeitsbereichen über Rollen gesteuert.3

Ebenso deutlich benennt OpenAI die Grenze: Der Lockdown Mode verhindert nicht, dass eine Injection in den verarbeiteten Inhalten auftaucht. Eine versteckte Anweisung in einer hochgeladenen Datei kann das Verhalten weiterhin beeinflussen und zu falschen Antworten führen. Und er garantiert keinen Schutz vor Abfluss, wenn Apps freigeschaltet bleiben oder neue Techniken auftauchen.3

Das ist die richtige Architekturentscheidung, und sie folgt einer Logik, die Simon Willison als tödliche Trias beschrieben hat: Ein Agent wird gefährlich, wenn er private Daten liest, fremde Inhalte verarbeitet und nach außen kommunizieren kann. Wer die Injection nicht verhindern kann, muss eines der drei Elemente wegnehmen. OpenAI nimmt den Ausgang. Den Preis zahlt der Nutzer in Funktionen, und genau darum ist der Modus optional.

Microsoft geht denselben Weg einen Schritt früher an. Defender für Office 365 Plan 2 prüft seit Anfang September eingehende E-Mails auf Prompt-Injection-Inhalte, bevor die Nachricht einen Nutzer oder einen KI-Assistenten erreicht. Die Prüfung läuft im selben Mailfluss wie der Phishing-Schutz und schließt versteckte Textsegmente ein.4 Das ist eine Filterlösung mit den bekannten Grenzen adaptiver Angriffe, aber an einer Stelle, an der sie wenig kostet.

LiteLLM: das Gateway als Generalschlüssel

Die dritte Meldung betrifft nicht ChatGPT, sondern die Infrastruktur, mit der Unternehmen ihre eigenen Modellzugänge bündeln. LiteLLM ist ein offenes Gateway, das über hundert Modellanbieter hinter einer einheitlichen Schnittstelle zusammenfasst. Es hält die API-Schlüssel aller angebundenen Anbieter, sieht jeden Prompt und jede Antwort und kann über MCP Werkzeuge anbinden. Wiz fand es nach eigenen Daten in etwa jeder dritten Cloud-Umgebung.2

Wiz hat rund 3.000 aus dem Internet erreichbare Instanzen untersucht. 9,6 Prozent akzeptierten den in der Dokumentation vorgegebenen Master-Key sk-1234 oder verlangten überhaupt keine Anmeldung. Dazu kommen zwei registrierte Schwachstellen: CVE-2026-59822 erlaubte es, mit einem beliebigen Bearer-Token eine gültige Sitzung am MCP-Endpunkt zu erzeugen, CVE-2026-59821 ließ angemeldete Nutzer über die Guardrail-Funktion eigenen Python-Code mit Root-Rechten im Proxy ausführen. Beide sind seit April behoben, beide wurden am 8. Juli in der NVD veröffentlicht.256 Die MCP-Lücke steht seit dem 2. September im Katalog ausgenutzter Schwachstellen der US-Behörde CISA, und Wiz hat die Ausnutzung im eigenen Honeypot beobachtet.2

Für dieses Portal ist der Fall aus einem Grund relevant, der über die einzelnen Lücken hinausgeht: Ein Gateway mit Standardpasswort ist kein Prompt-Injection-Problem. Aber es ist der Ort, an dem eine Injection den größten Schaden anrichten kann, weil dort die Schlüssel aller Anbieter und die Werkzeuganbindung zusammenlaufen. Wer Werkzeug-Missbrauch durch einen Agenten verhindern will, muss zuerst die Schicht absichern, über die der Agent seine Werkzeuge erreicht.

Konsequenz für Betreiber

Die drei Meldungen ergeben zusammen eine Reihenfolge, die sich auch in der Checkliste vor dem Produktivgang wiederfindet.

Erstens: Der Ausgang ist die Stelle, an der sich Schaden begrenzen lässt. Check Point zeigt, dass ein Ausgang existieren kann, den niemand geplant hat. Lockdown Mode zeigt, dass Anbieter das inzwischen als eigene Schutzschicht behandeln. Betreiber eigener Agenten sollten die Frage „wohin kann dieses System Daten senden“ mit einer vollständigen Liste beantworten können, nicht mit einer Annahme.

Zweitens: Die Infrastruktur unter dem Modell ist Teil der Angriffsfläche. Ein Gateway, ein Paketdienst, ein Container-Netz sind für Angreifer dasselbe wie für Betreiber: Wege. Das Dual-LLM-Muster und ähnliche Architekturen helfen nur, wenn die Schicht darunter nicht offensteht.

Drittens: Die Anbieter sagen selbst, was ihre Maßnahmen nicht leisten. OpenAI schreibt, dass der Lockdown Mode die Injection nicht verhindert. Microsoft ordnet seine Prüfung als eine Schicht unter mehreren ein. Diese Ehrlichkeit ist ein Fortschritt gegenüber früheren Ankündigungen. Sie bedeutet aber auch, dass die Verantwortung für die übrigen Schichten beim Betreiber bleibt.

Quellen

  1. Check Point Research: The Shared Clipboard Inside the Sandbox: Cross-Account Data Leakage in ChatGPT, 8. September 2026. https://research.checkpoint.com/2026/the-shared-clipboard-inside-the-sandbox-cross-account-data-leakage-in-chatgpt/
  2. Wiz Research: Breaking LiteLLM: From Auth Bypass to Cloud Compromise, 9. September 2026. https://www.wiz.io/blog/off-guard-breaking-litellm-from-authentication-bypass-to-cloud-compromise
  3. OpenAI Help Center: Lockdown Mode in ChatGPT. https://help.openai.com/en/articles/20001061-lockdown-mode-in-chatgpt
  4. Microsoft Learn: Prompt injection protection in Microsoft Defender for Office 365, Stand 2. September 2026. https://learn.microsoft.com/en-us/defender-office-365/step-by-step-guides/prompt-injection-protection-defender-for-office-365
  5. NVD: CVE-2026-59821. https://nvd.nist.gov/vuln/detail/CVE-2026-59821
  6. NVD: CVE-2026-59822. https://nvd.nist.gov/vuln/detail/CVE-2026-59822