DeBERTa Prompt-Injection-Klassifikator
protectai/deberta-v3-base-prompt-injection-v2 ist ein auf Microsoft DeBERTa-v3-base feinabgestimmter, englischsprachiger Binärklassifikator. Er gibt für eine Eingabe „benign“ oder „injection detected“ aus und wurde von Protect AI als lokaler Erkennungsbaustein für Prompt Injection veröffentlicht.1 Für den Stand August 2026 ist sein Wartungsstatus entscheidend: Die Modellkarte kennzeichnet das Projekt und den zugehörigen LLM-Guard-Code als archiviert und nicht mehr aktiv entwickelt oder gepflegt.1
Funktionsweise
Das Modell arbeitet als Textklassifikation, nicht als generatives Schutzmodell. Die Modellkarte nennt mehr als 20 erprobte Trainingskonfigurationen sowie einen Korpus aus öffentlichen Datensätzen und weiteren, aus Forschung, Wettbewerben und Community-Rückmeldungen abgeleiteten Beispielen.1 Die binäre Architektur ist für eine schnelle, lokale Vorprüfung sinnvoll, weil sie keine entfernte Moderations-API verlangt; zugleich modelliert sie weder die Vertrauensgrenze zwischen Systemanweisung und Dokument noch die Wirkung einer Werkzeugkette.
Die von Protect AI publizierten Kennzahlen sind klar als Herstellerwerte einzuordnen. Für eine Post-Training-Auswertung auf 20.000 Prompts aus nicht trainierten Datensätzen nennt die Modellkarte 95,25 Prozent Accuracy und 99,74 Prozent Recall.1 Diese Werte belegen weder eine allgemeine Erkennungsquote noch die Robustheit bei deutschsprachigen Dokumenten, neuen Manipulationsformen oder einer konkreten Agentenarchitektur. Als nachvollziehbare externe Anbindung existiert eine PINT-Benchmark-Konfiguration, die für v2 ebenfalls ein 512-Token-Limit und das Label INJECTION festlegt; die veröffentlichte Beispielseite liefert jedoch keine unabhängigen Ergebniswerte.2
Einsatz in der Praxis
Die Gewichte lassen sich mit Transformers als text-classification-Pipeline laden oder mit Optimum/ONNX Runtime für die lokale Ausführung bereitstellen. Die Modellkarte verweist außerdem auf LangChain-Integration und auf den früheren Einsatz in LLM Guard.1 Ein plausibler defensiver Einsatz liegt vor jedem Modellaufruf für kurze, englischsprachige Benutzertexte oder abgerufene Snippets. Lange Inhalte müssen wegen der 512-Token-Grenze strukturiert segmentiert werden; Ergebnisse gehören in Telemetrie und einen abgestuften Entscheidungsprozess, nicht als unbegründete Endentscheidung in die Geschäftslogik.1
Die lokale Ausführung ist ein Datenschutzvorteil gegenüber externen Klassifikationsdiensten, ändert aber nichts an der Pflegepflicht. Der Rückstand bei Modell-, Abhängigkeits- und Signaturupdates wiegt hier besonders schwer, weil die offizielle Projektseite ausdrücklich keine aktive Wartung mehr zusagt.1 Teams sollten deshalb Versionsfixierung, Reproduktionsprüfung und einen Austauschplan festlegen oder einen gepflegten Schutzmechanismus wählen.
Grenzen
Die Grenzen sind ungewöhnlich eindeutig dokumentiert: Das Modell erkennt laut Karte keine Jailbreaks, verarbeitet keine nicht-englischen Prompts und soll wegen False Positives nicht für Systemprompts verwendet werden.1 Schon deshalb ist es kein Ersatz für eine Zugriffskontrolle, eine Ausgabemoderation oder eine kontextbewusste Agentensicherung. Zusätzlich zeigt allgemeine Forschung zu Prompt-Klassifikatoren, dass Tests mit zufällig gemischten Datensätzen die Generalisierung gegenüber einer dataset-fremden Prüfung deutlich überschätzen können; diese Studie ist kein direkter Test dieses Modells.3
Lizenz und Bezug
Die Gewichte stehen unter der Apache License 2.0, also einer permissiven Open-Source-Lizenz mit Bedingungen zu Lizenz- und Hinweisweitergabe sowie Patentklausel.1 Technisch bleibt der Bezug über Hugging Face möglich, doch der Archivhinweis überlagert den Lizenzvorteil operativ. Protect AI wurde am 22. Juli 2025 von Palo Alto Networks übernommen und soll laut Käufer in Prisma AIRS integriert werden; daraus folgt keine dokumentierte Wiederaufnahme der Wartung dieses konkreten DeBERTa-Modells.4
Quellen
- Protect AI, „Model Card for deberta-v3-base-prompt-injection-v2“, 3. Mai 2024, https://huggingface.co/protectai/deberta-v3-base-prompt-injection-v2 ↩
- Lakera AI, „Benchmarking the protectai/deberta-v3-base-prompt-injection-v2 Model“, 15. Mai 2024, https://github.com/lakeraai/pint-benchmark/blob/main/examples/hugging-face/protectai/deberta-v3-base-prompt-injection-v2.md ↩
- Max Fomin, „When Benchmarks Lie: Evaluating Malicious Prompt Classifiers Under True Distribution Shift“, 19. Juli 2026, https://arxiv.org/abs/2602.14161 ↩
- Palo Alto Networks, „Palo Alto Networks Completes Acquisition of Protect AI“, 22. Juli 2025, https://www.paloaltonetworks.com/company/press/2025/palo-alto-networks-completes-acquisition-of-protect-ai ↩