Direkte Prompt Injection
Direkte Prompt Injection liegt vor, wenn eine Anweisung in dem Eingabekanal platziert wird, den die LLM-Anwendung unmittelbar vom Nutzer entgegennimmt, und dadurch die vorgesehene Modellaufgabe verändert wird. Sie unterscheidet sich von der indirekten Variante nicht durch eine andere Modellschwäche, sondern durch den Herkunftsweg des beeinflussenden Textes. OWASP beschreibt direkte Injection als unmittelbare Veränderung des Modellverhaltens durch den Nutzerprompt.1
Einordnung
Direkte Prompt Injection ist von indirekter Prompt Injection abzugrenzen: Dort stammt die problematische Anweisung aus externen Inhalten, die das System selbst verarbeitet. Bei der direkten Form besitzt die angreifende Person zumindest Zugriff auf die eigene Interaktion. Der unmittelbare Schaden ist deshalb oft auf diese Sitzung begrenzt, aber keineswegs immer harmlos. Er kann etwa entstehen, wenn die Anwendung zu weitreichende Werkzeuge freigibt, sensible Daten in ihren Kontext einbindet oder Modellantworten ohne Prüfung an Folgeprozesse übergibt.2
Ein Jailbreak ist ebenfalls keine vollständige Gleichsetzung. Er fokussiert die Umgehung von Sicherheitsvorgaben des Modells. Direkte Prompt Injection umfasst daneben die Manipulation einer anwendungsspezifischen Aufgabe, etwa wenn ein Modell seine Priorisierung, Zusammenfassung oder Werkzeugwahl entgegen dem Betreiberziel verschiebt. Die OWASP-Top-10 ordnet beide Begriffe als verwandt ein, beschreibt Jailbreaking aber als spezielle Form der Prompt Injection, die auf das vollständige Missachten von Sicherheitsprotokollen zielt.1
Dokumentiertes Beispiel
Die OWASP-Präventionshilfe dokumentiert direkte Eingaben als einen der typischen Angriffswege und warnt insbesondere davor, Nutzereingaben unkontrolliert mit Betreiberanweisungen zu verbinden.2 Als fachliches Beispiel genügt damit eine Anwendung, die Text von Nutzern entgegennimmt und ihn für eine automatische Bewertung oder Klassifikation an ein Modell weiterreicht: Wenn diese Bewertung unmittelbar weiterverarbeitet wird, kann eine direkte Manipulation mehr bewirken als eine fehlerhafte Antwort im Chat. Entscheidend ist der nachgelagerte Prozess, nicht die Formulierung der Eingabe.
Bedeutung für die Abwehr
Die Abwehr richtet sich gegen Auswirkungen. Nutzertexte sollten als nicht vertrauenswürdige Daten behandelt und nur mit minimal nötigem Kontext verarbeitet werden. Entscheidungen mit Rechts-, Geld-, Daten- oder Verfügungswirkung dürfen nicht allein aus einer Modellantwort folgen. Stattdessen prüft die Anwendung Berechtigungen, Parameterbereiche und Zustandsänderungen deterministisch; für besonders risikoreiche Schritte ist eine menschliche Freigabe angemessen.1
Filter für auffällige Anweisungen können Missbrauch erschweren und Beobachtbarkeit verbessern, aber sie bilden keine vollständige Schutzgrenze. Robustheitstests müssen auch prüfen, ob ein fehlgeleitetes Modell Daten lesen, Werkzeuge aufrufen oder Folgeobjekte erzeugen könnte. Wo Ausgabe oder Kontext dauerhaft gespeichert wird, ist zusätzlich das Risiko einer gespeicherten Prompt Injection zu bewerten: Dann kann aus einer lokalen Manipulation ein wiederkehrender Einfluss werden.
Quellen
- OWASP Foundation, „LLM01:2026 Prompt Injection“, 3. August 2026, https://genai.owasp.org/resource/owasp-genai-llm-top-10-2026/. ↩
- OWASP Foundation, „LLM Prompt Injection Prevention Cheat Sheet“, abgerufen am 20. August 2026, https://cheatsheetseries.owasp.org/cheatsheets/LLM_Prompt_Injection_Prevention_Cheat_Sheet.html. ↩