Prompt Injection
Prompt Injection bezeichnet eine Schwachstelle von LLM-Anwendungen, bei der eingegebener oder abgerufener Inhalt das Verhalten oder die Ausgabe des Modells gegen den vorgesehenen Anwendungszweck verändert. Entscheidend ist nicht, ob der Text sichtbar, vom Nutzer eingegeben oder aus einer Fremdquelle stammt: Er erreicht eine Komponente, die natürliche Sprache zugleich als Inhalt und als potenzielle Handlungsanweisung verarbeitet.1
Einordnung
Prompt Injection ist ein Oberbegriff. Direkte Prompt Injection beginnt in der eigenen Eingabe; bei indirekter Prompt Injection gelangt die Beeinflussung über abgerufene Webseiten, Dokumente, E-Mails oder Werkzeugergebnisse in den Modellkontext. Ein Jailbreak zielt enger darauf, modellseitige Sicherheitsvorgaben zu umgehen; eine Prompt Injection kann darüber hinaus die fachliche Aufgabe, Datenflüsse oder Werkzeugaufrufe einer Anwendung fehlleiten. OWASP führt Prompt Injection in seiner LLM Top 10 von 2025 als LLM01 und nennt unter möglichen Folgen die Preisgabe sensibler Informationen, unerlaubte Funktionsnutzung und die Manipulation von Entscheidungen.2
Die häufige Kurzformel, Anweisungen und Daten seien im Kontext „nicht getrennt“, benötigt Präzisierung: Aktuelle Schnittstellen übermitteln durchaus Rollen und priorisierte Nachrichten. Diese Struktur ist jedoch keine durchsetzbare Zugriffskontrolle. Forschung zur Instruktionshierarchie beschreibt gerade die konkurrierende Behandlung privilegierter Betreibertexte und nicht vertrauenswürdiger Texte als zentrale Ursache und verbessert die Robustheit durch Training, nicht durch eine absolute Trennung.3
Dokumentiertes Beispiel
Greshake und Kollegen beschrieben 2023 indirekte Prompt Injection als Angriff auf LLM-integrierte Anwendungen: Fremde Inhalte werden so platziert, dass sie später abgerufen und verarbeitet werden. Die Arbeit demonstrierte die praktische Durchführbarkeit gegen reale Systeme, darunter das damalige Bing Chat mit GPT-4, und untersuchte Auswirkungen wie Datenabfluss oder die Beeinflussung angebundener Schnittstellen.4 Das Beispiel belegt einen Integrationsfehler, nicht eine Eigenschaft eines einzelnen Chatfensters.
Bedeutung für die Abwehr
Die Abwehr muss deshalb die Folgen eines Fehlverhaltens begrenzen, nicht lediglich verdächtige Formulierungen suchen. Fremdinhalte sind als nicht vertrauenswürdig zu kennzeichnen und möglichst von Planungs- oder Entscheidungsschritten fernzuhalten. Rechte für Datenzugriffe und Werkzeuge gehören in serverseitige, deterministische Prüfungen mit geringsten Privilegien; risikoreiche Aktionen benötigen eine unabhängige Freigabe. Eingabe- und Ausgabefilter können zusätzliche Schichten sein, aber keine Sicherheitsgarantie darstellen.2 Eine belastbare Architektur behandelt das Modell als fehlbare Komponente und erzwingt Schutzgrenzen außerhalb des Prompts, etwa auf /schutz/.
Quellen
- OWASP Foundation, „LLM01:2026 Prompt Injection“, 3. August 2026, https://genai.owasp.org/resource/owasp-genai-llm-top-10-2026/. ↩
- OWASP Foundation, „LLM Prompt Injection Prevention Cheat Sheet“, abgerufen am 20. August 2026, https://cheatsheetseries.owasp.org/cheatsheets/LLM_Prompt_Injection_Prevention_Cheat_Sheet.html. ↩
- Eric Wallace et al., „The Instruction Hierarchy: Training LLMs to Prioritize Privileged Instructions“, 19. April 2024, https://arxiv.org/abs/2404.13208. ↩
- Kai Greshake et al., „Not what you’ve signed up for: Compromising Real-World LLM-Integrated Applications with Indirect Prompt Injection“, überarbeitete Fassung 5. Mai 2023, https://arxiv.org/abs/2302.12173. ↩