Instruktions-Hierarchie
Eine Instruktions-Hierarchie ist ein Regel- und Trainingskonzept, nach dem ein Sprachmodell kollidierende Anweisungen nach ihrer Vertrauensstufe gewichtet. In einer typischen Anwendung stehen System- und Entwicklervorgaben über Nutzeranweisungen; Inhalte aus abgerufenen Daten oder Werkzeugausgaben werden als Daten niedrigerer Vertrauensstufe behandelt. Die Hierarchie muss vom Modell gelernt und von der Anwendung konsistent übermittelt werden.1
Einordnung
Die Instruktions-Hierarchie ist keine bloße Reihenfolge von Textblöcken. Die Ausgangsarbeit identifiziert als Kernproblem, dass Modelle Systemvorgaben und untrusted Nutzer- oder Drittinhalte mit gleicher Priorität behandeln können. Sie schlägt Trainingsdaten vor, die Konflikte zwischen unterschiedlich privilegierten Anweisungen zeigen und das selektive Ignorieren niedriger priorisierter Anweisungen lehren.1 Damit unterscheidet sich der Ansatz von Spotlighting: Spotlighting markiert die Herkunft externer Daten, während die Hierarchie die Entscheidungsregel bei Konflikten beschreibt.
Auch eine perfekt formulierte Hierarchie ersetzt keine Autorisierung. Ein Modell kann eine hochpriorisierte Vorgabe korrekt verstehen und dennoch nur innerhalb der Rechte handeln dürfen, die die Anwendung technisch gewährt. Die aktuelle OWASP-Einordnung behandelt Prompt Injection deshalb als Risikofeld, das Vertrauensgrenzen, Zugriffskontrollen und adversariales Testen zusätzlich zur Modellsteuerung verlangt.2
Dokumentiertes Beispiel
Wallace und Kollegen wendeten ihr Trainingsverfahren auf GPT-3.5 an. Sie berichten deutlich erhöhte Robustheit auch für nicht im Training enthaltene Angriffstypen bei geringen Einbußen bei Standardfähigkeiten.1 Das ist ein dokumentiertes Forschungsergebnis, keine Aussage über alle Modelle oder eine Garantie gegen jede Prompt Injection.
Als Weiterentwicklung veröffentlichte OpenAI im März 2026 IH-Challenge, einen Trainingsdatensatz für Instruktionshierarchie, Safety-Steerability und Widerstand gegen in Werkzeugausgaben eingebettete Prompt Injection. OpenAI berichtet für ein intern trainiertes Modell bessere Resultate auf Hierarchie- und Prompt-Injection-Evaluationen sowie keine allgemeine Überverweigerung in den dargestellten Tests.3 Diese Zahlen sind Herstellerangaben zu konkreten Modellen und Benchmarks; sie belegen eine Entwicklungsrichtung, nicht die Sicherheit fremder Deployments.
Bedeutung für die Abwehr
Praktisch sollte die Anwendung Systemregeln, Entwicklerregeln, Nutzereingaben und externe Daten getrennt modellieren, statt sie zu einem undifferenzierten Textstrom zu verschmelzen. Die nachvollziehbare Protokollierung von Konfliktentscheidungen erleichtert zudem die spätere Analyse von Fehlverhalten und die gezielte Nachschärfung von Testszenarien. Eine Datenquelle darf keine implizite Befehlsautorschaft erhalten; StruQ oder strukturierte Nachrichten helfen, diese Grenze sichtbar zu halten. Bei Werkzeugaufrufen bleiben Server-seitige Richtlinien, Zustimmungsstufen und eng zugeschnittene Berechtigungen die maßgebliche Sicherheitsbarriere.2
Quellen
- Eric Wallace et al., „The Instruction Hierarchy: Training LLMs to Prioritize Privileged Instructions“, 19. April 2024, https://arxiv.org/abs/2404.13208. ↩
- OWASP Gen AI Security Project, „LLM01:2026 Prompt Injection“, 3. August 2026, https://genai.owasp.org/resource/owasp-genai-llm-top-10-2026/. ↩
- OpenAI, „Improving instruction hierarchy in frontier LLMs“, 10. März 2026, https://openai.com/index/instruction-hierarchy-challenge/. ↩