prompt injections.de
Cluster

Personen, die das Feld prägen

Prompt Injection als Feld hat wenige, klar benennbare Urheber. Dieser Cluster porträtiert die prägenden Personen — wer den Begriff prägte, wer die Angriffsklasse akademisch systematisierte und wer die realen Vorfälle dokumentiert.

Drei Personen markieren die drei Phasen, in denen sich das Feld gebildet hat. Simon Willison gab dem Phänomen am 12. September 2022 seinen Namen, als er Angriffe gegen GPT-3-Anwendungen als „Prompt Injection“ beschrieb, und liefert seither die laufende Einordnung: das Dual-LLM-Muster von 2023 und die „tödliche Trias“ von 2025, die benennt, unter welchen drei Bedingungen ein Agent zur Gefahr wird.

Kai Greshake hat die Angriffsklasse akademisch gefasst. Sein Paper vom Februar 2023 definierte indirekte Prompt Injection als eigene Kategorie: Die Anweisung kommt nicht vom Nutzer, sondern aus Inhalten, die das Modell verarbeitet. Die Arbeit wurde im November 2023 auf dem AISec-Workshop der CCS begutachtet und ist die meistzitierte Publikation des Feldes.

Johann Rehberger dokumentiert, was davon in produktiven Systemen tatsächlich funktioniert. Auf seinem Blog Embrace The Red stehen die Angriffsketten, die von Herstellern bestätigt und behoben wurden, darunter SpAIware gegen ChatGPT und die Serie zum ASCII-Smuggling. Viele Einträge im Vorfall-Verzeichnis dieses Portals gehen auf seine Meldungen zurück.

Die Steckbriefe sind kuratierte Sekundärdarstellungen: Jede Sachaussage ist an eine Primärquelle gebunden, jedes Profil verweist auf die eigenen Publikationen der Person. Sie ersetzen keine Selbstauskunft der Porträtierten. Zusammengestellt und gepflegt von Gökhan Köse.

Prägende Forscherinnen und Forscher 3