Rollenspiel-Jailbreak
Ein Rollenspiel-Jailbreak ist eine Jailbreak-Variante, bei der eine Anfrage in eine fiktive Rolle, Szene oder Erzählperspektive eingebettet wird, um ein Sprachmodell zu einer sonst unzulässigen Antwort zu bewegen. Nicht die sachliche Aufgabe verändert sich dabei zwingend, sondern ihr sozialer und narrativer Rahmen: Das Modell soll etwa als Figur, Autorität oder Erzähler sprechen, für die die normalen Grenzen angeblich nicht gelten.
Einordnung
Rollenspiel ist weder mit harmloser Kreativarbeit noch mit jeder fiktiven Anfrage gleichzusetzen. Zum Jailbreak wird die Rahmung erst, wenn sie darauf zielt, die vom Betreiber gesetzten Sicherheits- oder Verhaltensvorgaben zu verdrängen. Die Forschung zu real verbreiteten Jailbreak-Prompts zeigt, dass solche Prompts Schutzmechanismen umgehen sollen; sie dokumentiert zugleich, dass die Angriffsfamilien vielfältig sind und ein einzelnes sprachliches Merkmal keine belastbare Grenze bildet.1 Rollenspiel ist daher besser als Kontextmanipulation zu verstehen als als eigener Inhaltstyp: Die Anfrage versucht, eine unerwünschte Instruktion als legitim wirkende Fiktion erscheinen zu lassen.
Das grenzt den Begriff vom Prompt Engineering ab. Prompt Engineering optimiert gewöhnlich Verständlichkeit, Format oder Ergebnisqualität einer legitimierten Aufgabe. Ein Rollenspiel-Jailbreak nutzt ähnliche sprachliche Mittel, aber mit dem gegenteiligen Ziel, eine Priorität oder Schutzentscheidung des Systems zu unterlaufen. Er ist außerdem von indirekter Prompt Injection zu unterscheiden: Dort stammt die konkurrierende Instruktion aus einer externen Quelle wie einem Dokument oder einer Webseite; beim Rollenspiel-Jailbreak steht die Fiktionsrahmung typischerweise in der unmittelbaren Nutzereingabe. OWASP fasst Jailbreaking als spezielle Form direkter Prompt Injection ein.2
Dokumentiertes Beispiel
Die Arbeit GUARD untersucht Rollenspiel nicht als literarisches Phänomen, sondern als Methode für kontrolliertes Sicherheits-Testing. Die Autoren verwendeten mehrere Rollen, um natürlichsprachliche Jailbreak-Varianten zu erzeugen und die Einhaltung vorgegebener Richtlinien an offenen sowie kommerziellen Modellen zu prüfen.3 Dieses Forschungsdesign ist wichtig: Es belegt nicht, dass jede Rollenaufforderung erfolgreich ist oder dass einzelne Ergebnisse auf alle Modelle übertragbar wären. Es zeigt jedoch, warum Rollenszenarien in Testkatalogen vertreten sein müssen: Sie variieren Absicht, Ton und Kontext, ohne die zugrunde liegende Schutzanforderung offen zu benennen.
Bedeutung für die Abwehr
Eine belastbare Abwehr darf Fiktion deshalb nicht pauschal blockieren; das würde legitime Schreib-, Lern- und Simulationsaufgaben unnötig beschädigen. Entscheidend ist, ob das Modell trotz Rollenrahmen innerhalb seiner Aufgaben-, Rechte- und Inhaltsgrenzen bleibt. Betreiber sollten Rollenspielszenarien in adversariale Tests aufnehmen, die Ausgabe bei riskanten Kategorien nachgelagert prüfen und möglichen Schaden durch geringe Berechtigungen sowie menschliche Freigaben bei folgenreichen Aktionen begrenzen.2 Ein bloßer Satz im Systemprompt, der Rollenrahmen verbietet, ist keine eigenständige Sicherheitskontrolle. Zweckmäßig ist eine mehrschichtige Prüfung, die das beabsichtigte Ergebnis, die erlaubte Aktion und den Kontext gemeinsam bewertet.
Quellen
- Xinyue Shen et al., „Do Anything Now: Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models“, 15. Mai 2024, https://arxiv.org/abs/2308.03825 ↩
- OWASP Gen AI Security Project, „LLM01:2026 Prompt Injection“, 3. August 2026, https://genai.owasp.org/resource/owasp-genai-llm-top-10-2026/ ↩
- Haibo Jin et al., „GUARD: Role-playing to Generate Natural-language Jailbreakings to Test Guideline Adherence of Large Language Models“, 7. November 2025, https://arxiv.org/abs/2402.03299 ↩