Goal Hijacking
Goal Hijacking bezeichnet eine Form der Prompt Injection, bei der nicht zwingend eine Sicherheitsrichtlinie gebrochen wird, sondern die Aufgabe einer KI-Anwendung vom legitimen Nutzerziel auf ein vom Angreifer vorgegebenes Ziel umgelenkt wird. Maßgeblich ist damit die fehlende Aufgabentreue: Die Ausgabe kann sprachlich unauffällig oder regelkonform sein und dennoch nicht mehr dem Auftrag dienen.1
Einordnung
Der Begriff grenzt sich von Prompt Leaking ab, dessen Ziel die Offenlegung verborgener Anweisungen ist, und von einem Jailbreak, der typischerweise Sicherheitsvorgaben außer Kraft setzen soll. Goal Hijacking zielt dagegen auf die Priorisierung des falschen Ziels. Forschung zu universellem Goal Hijacking beschreibt dies als Prompt-Injection-Variante, die ein Sprachmodell dazu bringt, für beliebige normale Nutzeranfragen eine vorgegebene Zielantwort zu erzeugen.2 Bei agentischen Anwendungen kann die Umleitung über Text hinausreichen: Sie kann die Auswahl von Werkzeugen, Zwischenschritten oder Datenzugriffen vom Nutzerzweck entfernen.
Das Sicherheitsproblem liegt folglich nicht allein im Wortlaut eines Outputs. Ein System kann eine höfliche, plausible und nicht schädliche Antwort produzieren, obwohl es die erwartete Übersetzung, Zusammenfassung oder Recherche nicht ausgeführt hat. Inhaltsmoderation und Alignment bleiben wichtig, sind aber keine vollständige Prüfung darauf, ob jeder Verarbeitungsschritt dem vorgegebenen Ziel dient. Diese Perspektive ist besonders relevant, wenn ein Modell externe Inhalte verarbeitet oder mit Aktionen verbunden ist.
Dokumentiertes Beispiel
Liu et al. untersuchten Prompt Injection in 36 realen LLM-integrierten Anwendungen und berichteten 31 anfällige Anwendungen; zehn Anbieter hätten die Befunde validiert.1 Die Studie zeigt damit die Anwendungsebene, auf der eine Aufgabenübernahme relevant wird: Nicht nur das Grundmodell, sondern die Kombination aus vorgegebenem Anwendungskontext und fremdem Eingabetext bestimmt das Verhalten. Als präzisere Forschungsform untersuchte Huang et al. 2025 universelles Goal Hijacking auf vier verbreiteten Sprachmodellen und zehn Typen von Zielantworten.2 Die Ergebnisse sind ein dokumentierter Robustheitsbefund, keine Rechtfertigung, entsprechende Eingaben praktisch einzusetzen.
Bedeutung für die Abwehr
Wirksame Abwehr prüft zusätzlich zur Inhalts- und Rechtekontrolle die Bindung an den Nutzerauftrag. Für jeden risikoreichen Werkzeugaufruf sollte nachvollziehbar sein, welchen Teil des ursprünglichen Ziels er erfüllt; unklare oder nicht erforderliche Aktionen dürfen nicht autonom ausgeführt werden. Die ACL-Arbeit Task Shield operationalisiert diesen Ansatz als Prüfung, ob Anweisungen und Werkzeugaufrufe zu nutzerdefinierten Zielen beitragen, und berichtete auf AgentDojo eine niedrigere Angriffs-Erfolgsrate bei erhaltener Aufgabenutility.3 In der Praxis gehören dazu eng gefasste Werkzeugsrechte, Freigaben für folgenreiche Aktionen und Tests, die nicht nur Regelverstöße, sondern bewusst den Verlust der Aufgabentreue messen. Das ergänzt Schutzmaßnahmen gegen direkte Prompt Injection, statt sie zu ersetzen.
Recherche- und Rechtsstand: 20. August 2026.
Quellen
- Yi Liu et al., „Prompt Injection attack against LLM-integrated Applications“, 29. Dezember 2025, https://arxiv.org/abs/2306.05499. ↩
- Yihao Huang et al., „Efficient Universal Goal Hijacking with Semantics-guided Prompt Organization“, Juli 2025, https://aclanthology.org/2025.acl-long.290/. ↩
- Feiran Jia, Tong Wu, Xin Qin und Anna Squicciarini, „The Task Shield: Enforcing Task Alignment to Defend Against Indirect Prompt Injection in LLM Agents“, Juli 2025, https://aclanthology.org/2025.acl-long.1435/. ↩