prompt injections.de
Glossar

System-Prompt

Ein System-Prompt ist die vom Betreiber bereitgestellte Grundanweisung, die Rolle, Aufgabenrahmen, Ton oder Einschränkungen eines Sprachmodells festlegt. Je nach Schnittstelle heißt dieser hochrangige Kontextanteil System-, Developer- oder Instructions-Nachricht. Er steuert das Verhalten des Modells, ist aber weder ein sicherer Geheimnisspeicher noch eine belastbare Instanz für Autorisierung.1

Einordnung

Der System-Prompt ist ein Bestandteil des Prompts, nicht dessen Synonym. Er kann dem Modell eine Instruktionshierarchie signalisieren und für konsistenteres Verhalten sorgen. OpenAI dokumentiert für seine Responses API, dass instructions gegenüber dem input Vorrang erhalten und unter anderem Ziele sowie Stil definieren.2 Daraus folgt jedoch nur ein Vorrang im vorgesehenen Modellverhalten, keine unabhängige Zugriffsentscheidung. Die Forschung zur Instruktionshierarchie ordnet genau diese Priorisierung als Trainingsproblem ein: Das Modell soll niedrig privilegierte Konfliktanweisungen ignorieren lernen.3

Der verwandte Begriff Prompt Leaking bezeichnet die Preisgabe dieses Regeltexts. OWASP führt System Prompt Leakage seit der Ausgabe 2025 als LLM07. Die Organisation betont dabei einen wichtigen Unterschied: Nicht jeder offen gelegte Wortlaut ist für sich genommen die eigentliche Sicherheitsverletzung. Das grundlegende Risiko entsteht, wenn der Prompt Geheimnisse enthält oder wenn eine Anwendung Berechtigungen, Rollen und harte Regeln nur darin formuliert.1

Dokumentiertes Beispiel

Die OWASP-Beschreibung von LLM07 führt ein Szenario an, in dem ein System-Prompt Zugangsdaten für ein Werkzeug enthält und nach seiner Offenlegung missbraucht werden kann.1 Dieses dokumentierte Szenario ist bewusst kein Beleg dafür, dass System-Prompts grundsätzlich geheim bleiben. Es zeigt vielmehr den Konstruktionsfehler: Ein Geheimnis wurde an eine Modellkomponente gegeben, die den Text im Rahmen ihrer Antwortverarbeitung wiedergeben kann.

Bedeutung für die Abwehr

In einen System-Prompt gehören Aufgabenregeln, keine Kennwörter, Token, Verbindungsdaten oder vertraulichen Entscheidungsgrenzen. Rechteprüfung, Mandantentrennung, Transaktionslimits und Freigaben müssen serverseitig, deterministisch und prüfbar erfolgen. Die Anwendung sollte einer Modellantwort auch dann keine Berechtigung zuschreiben, wenn sie den Betreiberregeln sprachlich zu entsprechen scheint. Bei agentischen Abläufen empfiehlt OWASP außerdem, unterschiedliche Privilegstufen mit getrennten Komponenten und minimalen Rechten zu behandeln.1

Für die Abwehr von Prompt Injection bedeutet das: Ein sorgfältig formulierter System-Prompt ist nützlich, aber nur eine weiche Leitplanke. Die belastbare Grenze liegt in einem System, das sensible Daten nicht in den Prompt einbettet und kritische Handlungen außerhalb des Modells validiert. So bleibt ein möglicher Prompt Leak ein begrenztes Informationsereignis statt eines direkten Zugangsschlüssels.

Quellen

  1. OWASP Foundation, „LLM08:2026 Hidden Context Exposure“, 3. August 2026, https://genai.owasp.org/resource/owasp-genai-llm-top-10-2026/.
  2. OpenAI, „Text generation“, abgerufen am 20. August 2026, https://developers.openai.com/api/docs/guides/text.
  3. Eric Wallace et al., „The Instruction Hierarchy: Training LLMs to Prioritize Privileged Instructions“, 19. April 2024, https://arxiv.org/abs/2404.13208.