prompt injections.de
Werkzeug

Llama Prompt Guard

Llama Prompt Guard 2 ist Metas spezialisierter Textklassifikator für Prompt-Injection- und Jailbreak-Versuche. Die Reihe besteht aus einer 86M- und einer 22M-Variante und markiert eine Eingabe als „benign“ oder „malicious“.1 Anders als ein Inhaltsmoderator soll sie den Versuch erkennen, frühere oder eingebettete Anweisungen zu übersteuern; sie gehört damit an den Eingang eines LLM- oder RAG-Systems und ergänzt ausgabeseitige Schutzmodelle wie Llama Guard.

Funktionsweise

Die 86M-Ausgabe basiert auf mDeBERTa-base, die kleinere 22M-Ausgabe auf DeBERTa-xsmall. Beide sind BERT-artige Sequenzklassifikatoren und geben ausschließlich Klassen aus, keine generierte Begründung; die Modellkarte beschreibt einen modifizierten Energy-based-Loss und eine Tokenisierung, die Manipulationen mit Leerraum oder fragmentierten Tokens erschweren soll.2 Die aktuelle zweite Generation hat die frühere zusätzliche Klasse „injection“ bewusst aufgegeben und prüft stattdessen binär auf explizite Versuche, Entwickler- oder Nutzerinstruktionen zu überschreiben.2

Das Kontextfenster beträgt 512 Tokens. Längere Dokumente oder abgerufene Inhalte müssen deshalb segmentiert und parallel untersucht werden; ohne diese Aufteilung liegt ein Teil des Kontexts außerhalb der Klassifikation.1 Die 86M-Variante wurde laut Meta mit englischen und nicht-englischen Angriffsbeispielen trainiert und in Englisch, Französisch, Deutsch, Hindi, Italienisch, Portugiesisch, Spanisch und Thai bewertet. Die 22M-Variante verfügt dagegen wegen ihres englischen Basismodells über deutlich schwächere Mehrsprachenabdeckung.2

Einsatz in der Praxis

Der einfachste Integrationsweg ist eine lokale Transformers-Textklassifikation; für mehr Kontrolle dokumentiert Meta auch AutoTokenizer und AutoModelForSequenceClassification. Für längere Texte stellt Meta Hilfsprogramme zur parallelen Prüfung bereit und empfiehlt anwendungsspezifisches Fine-Tuning, um Genauigkeit und Fehlalarme für eigene Themen, Tool-Strukturen oder Dokumenttypen zu verbessern.1 Das Modell eignet sich damit als Vorfilter für Benutzereingaben und unzuverlässige RAG-Quellen, nicht aber als alleinige Autorisierungsschicht für Agenten.2

Die Modellkarte veröffentlicht Latenz- und Erkennungswerte, einschließlich einer AgentDojo-Auswertung. Diese Resultate stammen jedoch von Meta, teils aus einem privaten Benchmark, und sind daher als Anbieterangaben zu lesen.2 Für die Betriebsentscheidung wichtiger als ein einzelner Schwellenwert sind nachvollziehbare Maßnahmen bei einem Treffer: etwa Sperren, Quarantäne, Protokollierung oder menschliche Prüfung. Ein negativer Klassifikationsbefund belegt nicht, dass eine Eingabe die Logik eines Agenten nicht beeinflussen kann.

Grenzen

Meta benennt adaptive Angriffe ausdrücklich als Grenze: Gegen einen bekannten Klassifikator können neue Umgehungsversuche entwickelt werden. Zudem hängt die Trefferqualität von der jeweiligen Verteilung harmloser und schädlicher Eingaben ab, weshalb Meta Fine-Tuning auf anwendungsspezifische Daten empfiehlt.2 Die Binärentscheidung liefert keinen Nachweis, welche konkrete Stelle eines langen Dokuments problematisch war. Mehrstufige Manipulationen, deren Wirkung erst aus mehreren Gesprächsrunden, Tool-Zuständen oder Zugriffskontrollen entsteht, sind aus dieser Einzeltextklassifikation nicht ableitbar.

Unabhängige Forschung mahnt zusätzlich zu vorsichtiger Interpretation: Eine Studie über 18 Datensätze und mehrere Modellfamilien fand bei Prompt-Klassifikatoren erhebliche Einbußen unter echter Verteilungsverschiebung. Sie bewertet nicht gezielt Prompt Guard 2, spricht aber gegen die Übertragung isolierter Benchmarkwerte auf unbekannte Produktionsdaten.3

Lizenz und Bezug

Beide Gewichte stehen unter der Llama 4 Community License. Sie ist eine gebührenfreie, nicht übertragbare Lizenz für Nutzung, Vervielfältigung, Änderung und Weitergabe, koppelt die Weitergabe aber an Attribution, Lizenzbeilage, „Built with Llama“ sowie die Llama-4-Nutzungsrichtlinie.4 Für Anbieter mit mehr als 700 Millionen monatlich aktiven Nutzern gilt eine gesonderte kommerzielle Bedingung.4 Der Begriff „open-source“ sollte im Procurement daher durch die konkrete Community-Lizenz ersetzt werden.

Quellen

  1. Meta, „Llama Prompt Guard 2 | Model Cards and Prompt formats“, o. D., https://developer.meta.com/ai/docs/model-cards-and-prompt-formats/prompt-guard/
  2. Meta, „Llama Prompt Guard 2 Model Card“, 29. April 2025, https://huggingface.co/meta-llama/Llama-Prompt-Guard-2-86M
  3. Max Fomin, „When Benchmarks Lie: Evaluating Malicious Prompt Classifiers Under True Distribution Shift“, 19. Juli 2026, https://arxiv.org/abs/2602.14161
  4. Meta, „Llama 4 Community License Agreement“, 5. April 2025, https://huggingface.co/meta-llama/Llama-Prompt-Guard-2-86M