prompt injections.de
Glossar

Many-Shot-Jailbreaking

Many-Shot-Jailbreaking bezeichnet eine Jailbreak-Technik, bei der ein einzelner sehr langer Modelleingang viele fingierte Beispielinteraktionen enthält. Diese Beispiele stellen ein unerwünschtes Antwortmuster dar; am Ende folgt die eigentliche Zielanfrage, deren Behandlung das Modell nach dem zuvor gezeigten Muster fortsetzen soll. Der Angriff nutzt damit nicht eine einzelne Gegenanweisung, sondern die statistische Wirkung zahlreicher Demonstrationen im Kontextfenster.

Einordnung

Der Begriff wurde 2024 durch eine Anthropic-Untersuchung geprägt. Dort bestand der Kern aus einer Folge künstlicher Nutzer-Assistent-Dialoge innerhalb eines Prompts; die Versuche reichten bis zu 256 Beispielen.1 Die Autoren berichten für ihr untersuchtes Modell, dass die Wahrscheinlichkeit problematischer Antworten nach einer Schwelle mit der Zahl der Beispiele stieg. Das ist keine Eigenschaft jedes Modells in jeder Konfiguration, aber ein belastbarer Hinweis darauf, dass lange Kontexte eine zusätzliche Angriffsfläche schaffen können.

Many-Shot-Jailbreaking ist eng mit In-Context-Learning verbunden, aber nicht identisch. In-Context-Learning beschreibt allgemein, dass ein Modell eine Aufgabe aus Beispielen im Prompt erschließt, ohne seine Gewichte zu verändern. Many-Shot-Jailbreaking wendet dieselbe Fähigkeit auf ein sicherheitswidriges Ziel an. Anthropic fand für harmlose In-Context-Aufgaben und für diese Jailbreak-Variante ähnliche Skalierungstendenzen; daraus folgt nicht, dass Kontextlernen per se unsicher wäre, wohl aber, dass die für lange Eingaben erwünschte Anpassungsfähigkeit sicherheitsrelevant ist.1

Dokumentiertes Beispiel

Im dokumentierten Forschungsaufbau erscheinen zahlreiche erfundene Dialoge, in denen ein Assistent eine unerwünschte Verhaltensweise scheinbar fortsetzt; die Schlussanfrage fordert das Modell auf, dieses Muster weiterzuführen. Für kurze Folgen berichtete Anthropic weiterhin sicherheitsorientierte Ablehnungen, während eine große Zahl der Beispiele das Verhalten im untersuchten Setting verschob.1 Der Fall ist gerade deshalb für die Praxis aufschlussreich, weil er kein exotisches Format voraussetzt: Das Risiko entsteht aus der Kombination aus langem, untrusted Kontext und einem Modell, das Beispiele stark gewichtet.

Bedeutung für die Abwehr

Eine starre Begrenzung der Eingabelänge kann diese spezielle Technik bremsen, schränkt aber zugleich legitime Langdokument- und Analysefälle ein. Anthropic beschreibt zusätzliches Feintuning auf erkennbare Many-Shot-Muster als nur verzögernd; erfolgreicher waren in der Untersuchung Verfahren, die den Prompt vor der Modellübergabe klassifizieren und verändern.1 Für Anwendungen mit Nutzerdateien, RAG oder langen Gesprächsverläufen folgt daraus ein Defense-in-Depth-Prinzip: Kontextbudgets sind sinnvoll, reichen allein aber nicht. Externe Inhalte sollten als Daten markiert und getrennt verarbeitet, auffällige Muster vor der Inferenz bewertet und risikoreiche Modellaktionen durch minimale Berechtigungen begrenzt werden.2 Die zentrale Prüfgröße ist nicht nur die Tokenzahl, sondern ob zahlreiche fremde Demonstrationen die legitime Anwendungsinstruktion verdrängen können.

Quellen

  1. Anthropic, „Many-shot jailbreaking“, 2. April 2024, https://www.anthropic.com/research/many-shot-jailbreaking
  2. OWASP Gen AI Security Project, „LLM01:2026 Prompt Injection“, 3. August 2026, https://genai.owasp.org/resource/owasp-genai-llm-top-10-2026/