prompt injections.de
Glossar

DAN

DAN steht für „Do Anything Now“ und bezeichnet eine bekannte Familie öffentlich zirkulierender Jailbreak-Prompts. Gemeint sind Varianten, die einem Modell eine angeblich von Sicherheitsvorgaben entbundene Alternativrolle zuschreiben. DAN ist kein technischer Modus eines Modells und keine Berechtigungsebene, sondern ein sozial und sprachlich formulierter Versuch, die Ausrichtung des Systems zu unterlaufen.1

Einordnung

DAN gehört zur weiteren Klasse der Jailbreaks und überschneidet sich mit Prompt Injection, Rollenspiel und Privilegienbehauptungen. Der Begriff ist vor allem historisch und evaluativ nützlich: Varianten waren früh weithin sichtbar und wurden in öffentlichen Sammlungen fortgeschrieben. Die empirische Studie von Shen und Kollegen analysierte 1.405 Jailbreak-Prompts aus dem Zeitraum Dezember 2022 bis Dezember 2023, identifizierte 131 zugehörige Communities und beobachtete fortlaufende Optimierung durch einzelne Konten.1 Das unterscheidet DAN von einer einmaligen Schwachstelle. Es handelt sich um eine wandelbare Promptfamilie, sodass ein blockierter Wortlaut keine Aussage über die Robustheit gegen semantisch ähnliche Umgehungsversuche erlaubt.

Dokumentiertes Beispiel

Shen und Kollegen entwickelten für ihre Untersuchung JailbreakHub und testeten sechs verbreitete LLMs mit einem Korpus von 107.250 Anfragen über 13 untersagte Szenarien. Die Arbeit berichtet, dass die untersuchten Schutzmechanismen Jailbreak-Prompts nicht in allen Szenarien angemessen abwehrten; fünf besonders wirksame Prompts erreichten in der Studie hohe Erfolgsraten, und ein früher Prompt blieb mehr als 240 Tage online.1 Die Studie liefert damit eine dokumentierte Messung öffentlich geteilten Jailbreak-Wissens, aber keine Aussage über aktuelle Schutzwerte einzelner Produktversionen. Ergänzend zeigt die NeurIPS-Forschung, dass Safety-Training an konkurrierenden Zielen und mangelnder Generalisierung scheitern kann.2

Bedeutung für die Abwehr

DAN-Varianten gehören in Regressionstests, jedoch nur als Baseline. Eine Abwehr, die ausschließlich bekannte Namen, feste Rollenformulierungen oder einzelne Muster blockiert, misst eher Listenpflege als Sicherheit. OWASP empfiehlt eine Kombination aus Eingabevalidierung, klarer Trennung von Instruktionen und Daten, Ausgabemonitoring, Einschränkung von Berechtigungen und Protokollierung.3 In der Praxis sollten autorisierte Tests mit entschärften Zielen prüfen, ob das System trotz Rollenwechsel-, Ausnahme- oder Autoritätsbehauptungen bei bestätigter Aufgabe, Berechtigungen und Inhaltsregeln bleibt. Entscheidend ist auch der Umgang mit Folgeaktionen: Selbst eine fehlerhafte Modellantwort darf keine sensiblen Daten abrufen oder Werkzeuge mit weitergehenden Rechten auslösen. DAN nicht zu kennen ist ein Reifegradproblem; DAN allein zu erkennen ist noch kein belastbares Sicherheitsniveau.

Quellen

  1. Xinyue Shen et al., „‚Do Anything Now‘: Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models“, 7. August 2023, Fassung 15. Mai 2024, https://arxiv.org/abs/2308.03825
  2. Alexander Wei, Nika Haghtalab und Jacob Steinhardt, „Jailbroken: How Does LLM Safety Training Fail?“, NeurIPS 2023, https://proceedings.neurips.cc/paper_files/paper/2023/hash/fd6613131889a4b656206c50a8bd7790-Abstract-Conference.html
  3. OWASP Cheat Sheet Series, „LLM Prompt Injection Prevention Cheat Sheet“, laufend aktualisiert, abgerufen am 20. August 2026, https://cheatsheetseries.owasp.org/cheatsheets/LLM_Prompt_Injection_Prevention_Cheat_Sheet.html