Open-Prompt-Injection
Open-Prompt-Injection ist ein quelloffenes Python-Toolkit zur Implementierung und Bewertung von Prompt-Injection-Angriffen, Abwehrmaßnahmen sowie LLM-integrierten Anwendungen und Agenten. Das Repository wird einem Duke-Forschungsumfeld zugeordnet und verbindet einen konfigurationsbasierten Benchmark mit optionalen Detektions- und Lokalisierungskomponenten.1 Es ist daher sowohl ein Forschungskit als auch ein interner Evaluierungsbaustein, aber kein fertig betriebener Schutzdienst.
Funktionsweise
Die Grundarchitektur zerlegt eine Messung in austauschbare Bausteine: Modell, Zielaufgabe, injizierte Aufgabe, Angreifer, LLM-integrierte Anwendung und Evaluator werden aus Konfigurationsdateien erzeugt.1 Der Evaluator berechnet unter anderem einen ASV-Kennwert für die angegriffene Ausführung.1 Durch diese Trennung lassen sich Angriffs- und Abwehrvarianten gegen dieselbe Aufgabe vergleichen, ohne den gesamten Versuchsaufbau neu zu implementieren. Insofern passt das Projekt zu einer systematischen Prompt-Injection-Evaluation, nicht zu einer einzelnen Detektionsregel.
Das Repository integriert zusätzlich DataSentinel zur Erkennung kontaminierter Eingaben und PromptLocate zur Lokalisierung und Wiederherstellung betroffener Textabschnitte.1 Die dokumentierte Pipeline sieht vor, zunächst eine Kontamination zu erkennen und anschließend gegebenenfalls zu lokalisieren.1 DataSentinel wird im zugehörigen Forschungspapier als feinabgestimmte, spieltheoretisch formulierte Erkennung gegen adaptive Eingaben beschrieben; die Autoren berichten Ergebnisse über mehrere Benchmarks und LLMs.2 PromptLocate arbeitet laut Papier in drei Schritten aus semantischer Segmentierung, Identifikation instruktionskontaminierter Segmente und Eingrenzung datenkontaminierter Segmente.3
Einsatz in der Praxis
Die offizielle Anleitung richtet eine Conda-Umgebung aus der Projektdatei ein und liest Modellkonfigurationen aus Dateien ein; für externe Modelle müssen die jeweiligen Zugänge konfiguriert werden.1 Die Python-Schnittstelle erlaubt anschließend, Modelle, Aufgaben und Auswerter programmatisch zu instanziieren.1 Für DataSentinel und PromptLocate verweist die Dokumentation auf separat herunterladbare feinabgestimmte Checkpoints.1 Praktisch bedeutet das: Teams können das Framework in eine interne Test-Pipeline einbetten, sollten aber Modellversionen, Checkpoint-Versionen, Konfigurationen und Datensätze mitprotokollieren.
Die Komponenten sind nicht gleichzusetzen mit einer lückenlosen Abwehr im laufenden Betrieb. DataSentinel stellt eine Erkennungsentscheidung für Eingaben bereit; PromptLocate zielt auf Lokalisierung und Datenwiederherstellung nach einer festgestellten Kontamination.23 Die Hersteller- beziehungsweise Autorenangaben zur Erkennungsqualität sind als Ergebnisse unter ihren Benchmarks zu lesen, nicht als Garantie für neue Tools, Sprachen oder lange Mehrquellen-Kontexte. Eine Betriebsintegration braucht daher weiterhin Freigaben für Tool-Aktionen, Protokollierung und weitere Abwehrschichten.
Grenzen
Das Projekt bleibt von Modellzugängen, Konfigurationsdateien und teils separat bezogenen Checkpoints abhängig.1 Die Messgröße ASV und das Resultat eines Detektors sind nur im Kontext der gewählten Aufgabe, des Modells, der Angriffsklasse und der zugrunde liegenden Daten interpretierbar. Selbst PromptLocate bewertet nach eigener Darstellung acht bestehende und acht adaptive Angriffsvarianten; daraus folgt keine Vollständigkeit gegenüber unbekannten Varianten.3 Für eine unabhängige Studienlage zu der konkreten Gesamtpipeline des Repositories liegt in den hier geprüften Quellen kein separater Produktionsvergleich vor; verfügbar sind vor allem die Publikationen der eingebundenen Komponenten.
Lizenz und Bezug
Open-Prompt-Injection steht unter der MIT License und hat keinen dokumentierten kommerziellen Tarif.4 Zum Stichtag 20. August 2026 war das öffentliche Repository weder archiviert noch deaktiviert; der letzte Push stammte vom 29. Oktober 2025.4 Die Repository-Seite zeigt keine Tags und keine Releases.1 Für eine wiederholbare Nutzung ist daher ein festgehaltener Commit-Stand wichtiger als eine nicht vorhandene Paketversion. In den geprüften Primärquellen ist keine Übernahme- oder Einstellungsmitteilung zum Toolkit dokumentiert.14
Quellen
- Duke-Forschungsrepository, „Open-Prompt-Injection README“, Stand 20. August 2026, https://github.com/liu00222/Open-Prompt-Injection. ↩
- Liu et al., „DataSentinel: A Game-Theoretic Detection of Prompt Injection Attacks“, Version 4, 12. November 2025, https://arxiv.org/abs/2504.11358. ↩
- Jia et al., „PromptLocate: Localizing Prompt Injection Attacks“, Version 2, 17. Oktober 2025, https://arxiv.org/abs/2510.12252. ↩
- GitHub, „liu00222/Open-Prompt-Injection – Repository-Metadaten“, Abruf 20. August 2026, https://api.github.com/repos/liu00222/Open-Prompt-Injection. ↩