prompt injections.de
Glossar

Prompt Leaking

Prompt Leaking bezeichnet die Offenlegung eines System-Prompts oder anderer verdeckter Betriebsanweisungen einer LLM-Anwendung. Der Begriff beschreibt damit zunächst einen Informationsabfluss: Ein Nutzer oder fremder Inhalt bringt das System dazu, Teile seiner vorrangigen Instruktionen wiederzugeben. Kritisch wird dies, wenn der Prompt technische Details, interne Entscheidungsregeln oder Daten enthält, deren Veröffentlichung Folgen außerhalb des Sprachmodells hat.1

Einordnung

Prompt Leaking ist eng mit Prompt Injection verbunden, aber nicht mit ihr gleichzusetzen. Prompt Injection verändert die beabsichtigte Verarbeitung von Eingaben; Prompt Leaking ist ein mögliches Ergebnis oder Ziel einer solchen Manipulation. OWASP führt die Offenlegung als LLM08:2026 Hidden Context Exposure, betont aber eine wichtige Abgrenzung: Der Prompt selbst ist kein tragfähiges Geheimnis und darf keine Sicherheitskontrolle ersetzen. Sichtbar gewordener Wortlaut ist daher oft weniger das Primärproblem als vertrauliche Daten im Prompt, fehlende Autorisierungsprüfungen oder eine unzulässige Delegation von Berechtigungsentscheidungen an das Modell.1 Gegenüber System Prompt bezeichnet Prompt Leaking folglich nicht die Anweisungsschicht, sondern deren unerwünschte Preisgabe.

Dokumentiertes Beispiel

Die CCS-2024-Arbeit PLeak untersuchte Prompt-Leaking als Closed-Box-Problem, also ohne Zugriff auf Modellgewichte oder interne Implementierung. Die Autoren evaluierten ihren Forschungsrahmen sowohl offline als auch gegen reale, auf Poe angebotene LLM-Anwendungen und berichten, dass er die verglichenen manuellen und optimierten Verfahren bei der Extraktion von System-Prompts übertraf.2 Das dokumentiert nicht, dass jeder System-Prompt beliebig auslesbar ist. Es zeigt jedoch, dass die Vertraulichkeit eines vor dem Nutzer verborgenen Prompts keine verlässliche Systemannahme sein sollte. Eine spätere Vorveröffentlichung ordnet insbesondere private Konfigurationsdetails, Rollen und Betriebsanweisungen im System-Prompt als schutzbedürftige Inhalte ein.3

Bedeutung für die Abwehr

Die zentrale Entwurfsregel lautet: Ein System-Prompt darf nichts enthalten, dessen Offenlegung einen Sicherheits- oder Geschäftsschaden erzeugt. Zugangsdaten, Verbindungsparameter, Tokens, interne Freigabegrenzen und Berechtigungslogik gehören in getrennte Systeme; Entscheidungen über Zugriff, Privilegien und Tool-Aufrufe müssen deterministisch, prüfbar und außerhalb des LLM durchgesetzt werden.1 Zusätzliche Ausgabekontrollen können auffällige Instruktionsfragmente oder Geheimnisformate erkennen, ersetzen diese Architektur aber nicht. Für Tests sind kontrollierte Extraktionsversuche gegen eigene Anwendungen und die Überprüfung, ob Antworten interne Anweisungen wiedergeben, sinnvoll. Der Befund wird als Sicherheitsmangel behandelt, wenn damit eine nachgelagerte Kontrolle umgangen, ein Geheimnis offengelegt oder ein Angriff auf andere Komponenten präzisiert werden kann.1

Quellen

  1. OWASP GenAI Security Project, „LLM08:2026 Hidden Context Exposure“, 3. August 2026, https://genai.owasp.org/resource/owasp-genai-llm-top-10-2026/
  2. Bo Hui et al., „PLeak: Prompt Leaking Attacks against Large Language Model Applications“, 2024, Fassung 2025, https://arxiv.org/abs/2405.06823
  3. Badhan Chandra Das, M. Hadi Amini und Yanzhao Wu, „System Prompt Extraction Attacks and Defenses in Large Language Models“, 27. Mai 2025, https://arxiv.org/abs/2505.23817