Johann Rehberger
Johann Rehberger („wunderwuzzi“) hat mit seinem Blog Embrace The Red die wichtigste Praxis-Quelle für real ausgenutzte Prompt-Injection-Angriffe geschaffen — von SpAIware bis ASCII-Smuggling.
- Rolle im Feld
- KI- und LLM-Red-Teaming; entdeckt und veröffentlicht reale Angriffsketten gegen produktive KI-Systeme
- Werdegang
- über 20 Jahre in Threat Modeling, Penetrationstesting und Red Teaming; Stationen bei Microsoft, Uber und Electronic Arts
- Aktuelle Rolle
- Red Team Director bei Electronic Arts
- Handle
- „wunderwuzzi“
- Dokumentierte Angriffe (Auswahl)
- SpAIware (ChatGPT macOS, 2024), ASCII-Smuggling (2024), diverse Memory-Injection-Ketten
- Eigene Plattform
- embracethered.com
Wer ist Johann Rehberger?
Johann Rehberger ist Sicherheitsforscher mit über 20 Jahren Erfahrung in Threat Modeling und Red Teaming. Aktuell ist er Red Team Director bei Electronic Arts; zuvor arbeitete er bei Microsoft und Uber.
Unter dem Handle „wunderwuzzi“ ist er für die konsequente Dokumentation realer Prompt-Injection-Angriffsketten bekannt. Sein Blog Embrace The Red ist die wichtigste einzelne Praxis-Quelle des Feldes.
Warum sein Blog so wichtig ist
Rehberger arbeitet nach einem klaren Muster: einen Angriff gegen ein reales Produktivsystem finden, ihn als durchgängigen End-to-End-Exploit belegen, verantwortungsvoll an den Hersteller melden, bis zum Fix warten und erst dann mit vollständiger Zeitleiste veröffentlichen.
Diese Kombination aus Responsible Disclosure und öffentlicher Analyse ist im KI-Sicherheitsbereich selten. Sie macht seine Befunde für Hersteller anschlussfähig — mehrere seiner Meldungen wurden direkt in Fix-Prozesse übernommen.
Zentrale dokumentierte Vorfälle
SpAIware (2024): Über ein injiziertes Memory-Feature exfiltrierte ChatGPT auf macOS persistent alle künftigen Chat-Nachrichten. Im Mai 2024 gemeldet, im September 2024 von OpenAI in Version 1.2024.247 behoben, danach offengelegt. Details unter SpAIware.
ASCII-Smuggling (2024): Rehberger systematisierte die Nutzung des Unicode-Tag-Blocks als für Menschen unsichtbaren, für Modelle lesbaren Kanal und zeigte Ausnutzungen gegen mehrere kommerzielle Systeme.
Datenexfiltration über Markdown-Bilder: Ein Modell rendert ein Bild mit angreiferkontrolliertem Server als Ziel; sensible Daten landen in der Bild-URL. Rehberger meldete diesen Vektor 2023 — siehe Datenexfiltration über Markdown-Bilder.
Rolle in der Trias
Wenn Simon Willison der Übersetzer für die Öffentlichkeit ist und Kai Greshake der akademische Systematiker, dann ist Rehberger der Praxis-Beweiser. Die drei zusammen bilden das Rückgrat der öffentlich sichtbaren Prompt-Injection-Forschung.
Zeitleiste
- April 2023
- Datenexfiltration über Bild-Rendering an OpenAI gemeldet
- Dezember 2023
- OpenAI führt einen Teilfix (
url_safe) in der Web-App ein - Mai 2024
- Memory-Injection in ChatGPT gemeldet — Grundlage für SpAIware
- September 2024
- OpenAI-Fix in ChatGPT v1.2024.247; öffentliche Disclosure bei BSides Vancouver Island
- 2024
- ASCII-Smuggling-Serie auf Embrace The Red — Angriffsklasse systematisiert
- 2025
- Weitere Analysen zu MCP-Tool-Poisoning und EchoLeak-Vorläufern
Quellen
- Rehberger, J.: Embrace The Red — AI Security Blog: https://embracethered.com/
- Rehberger, J. (2024): ChatGPT macOS Persistent Data Exfiltration (SpAIware): https://embracethered.com/blog/posts/2024/chatgpt-macos-app-persistent-data-exfiltration/
Handles und Profil-URLs prägender Personen können sich ändern; die sameAs-Angaben spiegeln den Stand der Kuratierung.