Llama 4
Llama 4 umfasst die instruction-tuned und vortrainierten Mixture-of-Experts-Modelle Llama 4 Scout und Llama 4 Maverick. Meta positioniert beide für multimodales Verstehen, Tool-Calling und agentische Systeme; sie verarbeiten Text und Bildinhalte und verfügen über große Kontextfenster.1 Für Betreiber erhöht diese Kombination die Schutzanforderungen: Jede eingebundene Datenquelle, jedes Bild und jeder Werkzeugpfad kann den Sicherheitskontext eines Agenten beeinflussen.
Einordnung
Nach Metas Dokumentation akzeptiert Scout Text und bis zu fünf Bilder, Maverick Text und bis zu zehn Bilder; die angegebenen maximalen Kontextlängen reichen bis zu zehn Millionen beziehungsweise einer Million Token.1 Diese Leistungsmerkmale sind keine Schwachstelle. Sie erweitern jedoch die Einfallswege, über die nicht vertrauenswürdige Informationen in eine Entscheidungskette gelangen können. Neben Text sind deshalb extrahierte Bildinhalte, Dokumentenanhänge, Webseiten und Tool-Rückgaben als potentielle Träger fremder Instruktionen zu behandeln.
Direkte, öffentlich geprüfte AgentDojo- oder Open-Prompt-Injection-Ergebnisse für Llama 4 wurden in den gesichteten Primärquellen nicht gefunden. Das Fehlen eines veröffentlichten Werts erlaubt weder eine Entwarnung noch eine Rangfolge. Betreiber sollten die Modellvariante, den Bild- und Textvorverarbeitungspfad sowie die angeschlossenen Funktionen unter eigenen Bedingungen testen und die Ergebnisse getrennt von allgemeinen Leistungsbenchmarks bewerten.
Dokumentierte Schwächen
HiddenLayer zählt Llama 4 Scout und Maverick in seinem Bericht zu „Policy Puppetry“ zu den betroffenen Modellfamilien. Der Anbieter beschreibt einen promptbasierten Bypass, der sich als Policy- oder Konfigurationsmaterial tarnt und nach seiner Darstellung Alignment- und Systemprompt-Schutz umgehen kann.2 Der Bericht belegt damit einen extern dokumentierten Umgehungsversuch gegen die Llama-4-Familie, aber keine standardisierte, unabhängig reproduzierte Erfolgsrate für jedes Release oder Hosting-Szenario.2
Die korrekte Schlussfolgerung ist deshalb präzise: Llama 4 ist nicht als injection-immun anzunehmen, und die zusätzliche multimodale beziehungsweise agentische Verarbeitung verlangt Tests über reine Chatprompts hinaus. Zugleich wäre es nicht sachgerecht, aus einem Anbieterbericht auf eine allgemeine Kompromittierung aller Llama-4-Installationen zu schließen. Entscheidend sind konkrete Version, Systemprompt, Kontextaufbau, Rechte und externe Schutzschichten.
Schutzmechanismen des Anbieters
Meta stellt LlamaFirewall als quelloffenes Guardrail-Framework für KI-Agenten bereit. Nach Anbieterangabe kombiniert es PromptGuard 2 zur Jailbreak-Erkennung, Agent Alignment Checks zur Prüfung auf Prompt Injection und Zielabweichung sowie CodeShield gegen unsicheren Code.3 Meta bezeichnet die Schicht ausdrücklich als letzte Verteidigungsebene und räumt ein, dass es für diese Risiken keine deterministischen Lösungen gibt; die Agent Alignment Checks werden als experimentell beschrieben.3
Daraus folgt eine wichtige Architekturaussage: LlamaFirewall ist ein separater Systembaustein, keine zwingend im Llama-4-Modell aktivierte Eigenschaft.3 Seine Qualität und Konfiguration sind daher ebenso zu testen wie das Grundmodell. Einen einzelnen Detektor als alleinige Schutzmaßnahme einzusetzen, wäre angesichts der dokumentierten Grenzen nicht angemessen.
Bedeutung für Betreiber
Für Llama 4 empfiehlt sich eine explizit multimodale Bedrohungsmodellierung. Eingehende Bilder und Dokumente werden vor der Agentenentscheidung klassifiziert und mit Herkunftsmetadaten versehen; fremde Inhalte dürfen die Rollen- und Rechtehierarchie nicht verändern. Tool-Aufrufe sollten über eng begrenzte, strukturierte Schnittstellen laufen und sensible Folgen wie Datenexporte oder externe Kommunikation unabhängig bestätigen lassen.
Die praktische Abnahme kombiniert PromptGuard- oder LlamaFirewall-Tests mit systematischen Fällen aus AgentDojo und eigenen multimodalen Szenarien. Dabei werden nicht nur Antworttexte, sondern auch Tool-Auswahl, Datenfluss und abgebrochene Angriffe gemessen. Die umfassenderen Schutzmaßnahmen bleiben auch mit Llama 4 unverzichtbar: Modellschutz reduziert Risiko, Rechtebegrenzung und nachvollziehbare Freigaben begrenzen den Schaden bei einer erfolgreichen Umgehung.
Quellen
- Meta, „Llama 4 | Model Cards and Prompt formats“, Dokumentation, abgerufen am 20. August 2026, https://developer.meta.com/ai/docs/model-cards-and-prompt-formats/llama4/ ↩
- Conor McCauley et al., HiddenLayer, „Novel Universal Bypass for All Major LLMs“, 24. April 2025, https://www.hiddenlayer.com/research/novel-universal-bypass-for-all-major-llms ↩
- Meta, „LlamaFirewall: An open source guardrail system for building secure AI agents“, 29. April 2025, https://ai.meta.com/research/publications/llamafirewall-an-open-source-guardrail-system-for-building-secure-ai-agents/ ↩