prompt injections.de
Glossar

Crescendo

Crescendo ist eine mehrstufige Jailbreak-Technik, die mit einer zunächst plausiblen Frage beginnt und den Gesprächsverlauf schrittweise in Richtung eines nicht zulässigen Ziels verschiebt. Die späteren Nachfragen knüpfen dabei an frühere Modellantworten an. Der Name beschreibt die graduelle Steigerung; das Sicherheitsproblem entsteht aus der Gesamtsequenz, nicht aus einer isolierten Formulierung.1

Einordnung

Russinovich, Salem und Eldan führten Crescendo 2024 als Multi-Turn-Jailbreak ein. In ihrer Beschreibung interagiert die Methode scheinbar unbedenklich, beginnt allgemein und steigert den Dialog durch Bezug auf Modellantworten.1 Damit gehört sie wie Echo Chamber zur Klasse verlaufsabhängiger Jailbreaks, unterscheidet sich aber in der fachlichen Beschreibung: Crescendo betont die graduelle Eskalation vom allgemeinen Ausgangspunkt, Echo Chamber die Rückkopplung eines vergifteten Gesprächskontexts. Beide zeigen, warum ein Schutz nicht allein an einzelnen Eingaben oder Schlüsselwörtern gemessen werden darf. Ein Modell kann auf jede Teiletappe regelkonform wirken, während die Sequenz als Ganzes eine Sicherheitsgrenze überschreitet.

Dokumentiertes Beispiel

Die Crescendo-Arbeit evaluiert die Methode gegen mehrere öffentliche Systeme, darunter ChatGPT, Gemini, Llama-Varianten und Anthropic Chat, und berichtet hohe Erfolgsraten in den geprüften Aufgaben.1 Die Autoren stellten außerdem Crescendomation vor, eine Automatisierung für ihre Forschungsevaluation; die revidierte Arbeit wurde für USENIX Security 2025 angenommen.1 Das ist ein belastbarer Anlass, Mehrturn-Verläufe in Red-Team-Programmen zu prüfen, aber keine Rechtfertigung für produktive Angriffsausführung. Die heute offizielle PyRIT-Dokumentation führt Crescendo neben weiteren Strategien für automatisiertes und menschlich begleitetes Red Teaming auf und unterstützt standardisierte Bewertungen sowie die Speicherung von Testverläufen.2

Bedeutung für die Abwehr

Die passende Gegenmaßnahme ist eine Bewertung auf Dialogebene. Sie verbindet jede neue Anfrage mit dem bestätigten Nutzerziel, bisherigen Sicherheitsentscheidungen und der Frage, ob eine beabsichtigte Aktion innerhalb der freigegebenen Aufgabe liegt. Microsoft weist bei PyRIT ausdrücklich darauf hin, dass Automatisierung manuelles Red Teaming ergänzt und nicht ersetzt; Mehrturn-Tests sind deshalb nachvollziehbar zu dokumentieren und durch Fachleute zu bewerten.3 In der Produktarchitektur sollten sensible Rechte, Datenzugriffe und Tool-Aufrufe unabhängig vom Dialogverlauf autorisiert werden. Begrenzte Sitzungen, erneute Aufgabenbestätigung bei Zielwechseln und getrennte Behandlung nicht vertrauenswürdiger Inhalte reduzieren den Schaden eines fehlgeleiteten Kontexts. Für Tests eignen sich autorisierte, harmlose Stellvertreterziele und Erfolgsmetriken wie unerlaubte Zielabweichung, Preisgabe oder unzulässiger Tool-Vorschlag — nicht die Erzeugung gefährlicher Inhalte.4

Quellen

  1. Mark Russinovich, Ahmed Salem und Ronen Eldan, „Great, Now Write an Article About That: The Crescendo Multi-Turn LLM Jailbreak Attack“, 2. April 2024, Fassung 26. Februar 2025, https://arxiv.org/abs/2404.01833
  2. Microsoft, „PyRIT — Python Risk Identification Tool“, Stable v1.0.1, abgerufen am 20. August 2026, https://azure.github.io/PyRIT/
  3. Ram Shankar Siva Kumar, Microsoft, „Announcing Microsoft’s open automation framework to red team generative AI systems“, 22. Februar 2024, https://www.microsoft.com/en-us/security/blog/2024/02/22/announcing-microsofts-open-automation-framework-to-red-team-generative-ai-systems/
  4. OWASP Cheat Sheet Series, „LLM Prompt Injection Prevention Cheat Sheet“, laufend aktualisiert, abgerufen am 20. August 2026, https://cheatsheetseries.owasp.org/cheatsheets/LLM_Prompt_Injection_Prevention_Cheat_Sheet.html