prompt injections.de
Werkzeug

Llama Guard

Llama Guard 4 ist Metas aktuell veröffentlichter, nativ multimodaler Sicherheitsklassifikator mit 12 Milliarden Parametern. Er bewertet Eingaben und Antworten eines Sprachmodells anhand einer Gefahren- und Richtlinientaxonomie als sicher oder unsicher und kann bei einem Treffer verletzte Kategorien ausgeben.1 Das Werkzeug setzt an der Inhaltsbewertung an, nicht an der Durchsetzung von Anwendungslogik; es ist daher ein Baustein einer mehrschichtigen Schutzarchitektur, aber kein alleiniger Schutz gegen Prompt Injection.

Funktionsweise

Technisch ist Llama Guard 4 ein aus Llama 4 Scout abgeleiteter, dichter Early-Fusion-Transformer. Meta entfernte die gerouteten MoE-Experten und behielt den gemeinsamen Experten bei; Tokenizer und Vision Encoder werden mit Llama 4 Scout und Maverick geteilt.2 Das Modell verarbeitet Text sowie kombinierte Text-Bild-Eingaben, kann mehrere Bilder einbeziehen und klassifiziert sowohl Nutzeranfragen als auch Modellantworten.2 Seine Standardrichtlinie orientiert sich an der MLCommons-Gefahrentaxonomie und umfasst unter anderem Gewalt, nicht gewaltsame Delikte, Privatsphäre, Wahlprozesse, Selbstgefährdung sowie Missbrauch eines Code Interpreters.2

Die Richtlinie ist promptbasiert konfigurierbar: Integrationen übergeben eine Rollenangabe, die zu prüfende Konversation und Beschreibungen unsicherer Kategorien. Diese Kategorien und ihre Beschreibungen lassen sich im Zero- oder Few-Shot-Kontext an eigene Regeln anpassen; das ist eine Richtlinienanpassung, kein erneutes Training des Modells.1 Für Eingaben und Antworten verlangt die Vorlage unterschiedliche Kontexte: Bei der Ausgabekontrolle muss die vorausgehende Nutzeranfrage mitgeliefert werden, damit die Bewertung den Kontext einbezieht.1

Einsatz in der Praxis

Praktisch eignet sich Llama Guard 4 als lokaler Vor- und/oder Nachfilter vor beziehungsweise nach einem generativen Modell. Meta dokumentiert Zugänge über Transformers, vLLM, SGLang und Docker; vLLM und SGLang können ihn als OpenAI-kompatiblen Dienst bereitstellen.2 Meta beschreibt ihn außerdem als Ersatz für Llama Guard 3 8B und 11B in Text- und multimodalen Anwendungen sowie als kompatibel mit Llama-3-Modellen.1 Die gleichzeitige Ein- und Ausgabekontrolle kann Sicherheitsverletzungen an zwei Stellen des Datenflusses prüfen, ersetzt aber weder Rechteprüfungen noch die Trennung vertrauenswürdiger Anweisungen von fremden Dokumentinhalten.2

Für Bildfälle ist der Einsatz enger als die Bezeichnung „multimodal“ vermuten lässt. Die offizielle Dokumentation verlangt Text zusammen mit dem Bild, nennt englischen Text als Optimierungsziel und schließt die Prüfung von Bildern aus, die selbst durch generative KI erzeugt wurden.1 Vor dem Produktionsbetrieb sollten Teams deshalb ihre tatsächlichen Sprachen, Dokumentformate und Eskalationspfade gegen eigene, harmlose Testfälle prüfen.

Grenzen

Meta weist ausdrücklich darauf hin, dass die Leistung durch Vortrainingsdaten begrenzt ist und dass Kategorien wie Verleumdung, Urheberrecht und Wahlen aktuelles Faktenwissen erfordern können. Für besonders sensible Fälle empfiehlt Meta komplexere Systeme; die Modellkarte positioniert Llama Guard 4 nur als Baseline für allgemeine Einsätze.2 Die veröffentlichte Evaluation ist eine Meta-interne Auswertung; Vergleichstests gegen konkurrierende Modelle lässt Meta nach eigener Aussage aus, weil die Richtlinien nicht deckungsgleich seien.2 Leistungswerte sind damit Anbieterangaben, nicht der Nachweis einer universellen Schutzwirkung.

Besonders relevant für dieses Portal ist Metas eigener Hinweis, dass Llama Guard 4 als LLM durch adaptive oder Prompt-Injection-Angriffe umgangen oder in seiner vorgesehenen Nutzung beeinflusst werden kann. Meta verweist hierfür auf Llama Prompt Guard 2 als ergänzende Erkennungsschicht.2 Eine unabhängige Studie zu Prompt-Klassifikatoren zeigt zudem allgemein, dass herkömmliche Cross-Validation gegenüber einer Leave-One-Dataset-Out-Prüfung die AUC um 8,0 bis 16,5 Punkte überschätzen kann; sie untersucht nicht spezifisch Llama Guard 4, begründet aber vorsichtige lokale Validierung.3

Lizenz und Bezug

Die Gewichte sind unter der Llama 4 Community License verfügbar, also kostenlos nutzbar, veränderbar und weitergebbar unter vertraglichen Bedingungen.2 Bei Weitergabe sind Lizenztext, Attribution und der Hinweis „Built with Llama“ vorgeschrieben; wer zum Veröffentlichungszeitpunkt von Llama 4 mehr als 700 Millionen monatlich aktive Nutzer hatte, benötigt eine zusätzliche Meta-Lizenz.2 Der Bezug über Hugging Face ist zugangsbeschränkt und setzt die Annahme dieser Bedingungen voraus.2

Quellen

  1. Meta, „Llama Guard 4 | Model Cards and Prompt formats“, o. D., https://developer.meta.com/ai/docs/model-cards-and-prompt-formats/llama-guard-4/
  2. Meta, „Llama Guard 4 Model Card“, 29. April 2025, https://huggingface.co/meta-llama/Llama-Guard-4-12B
  3. Max Fomin, „When Benchmarks Lie: Evaluating Malicious Prompt Classifiers Under True Distribution Shift“, 19. Juli 2026, https://arxiv.org/abs/2602.14161