prompt injections.de
Glossar

Adversariale Eingabe

Eine adversariale Eingabe ist ein Text- oder Tokenbestandteil, der gezielt so gestaltet wird, dass ein Modell von seiner vorgesehenen Aufgabe, seinen Sicherheitsvorgaben oder seiner Priorisierung abweicht. Bei Sprachmodellen umfasst der Begriff sowohl algorithmisch optimierte Zeichenfolgen als auch sprachlich plausible Formulierungen; entscheidend ist die beabsichtigte Fehlsteuerung, nicht die äußere Form.1 2

Einordnung

Der Ausdruck ist ein Oberbegriff, kein Synonym für Jailbreak oder indirekte Prompt Injection. Ein Jailbreak zielt typischerweise auf das Umgehen modellseitiger Einschränkungen; eine indirekte Injektion nutzt dagegen fremde Inhalte, die eine Anwendung etwa aus Webseiten, Dateien oder Werkzeugausgaben übernimmt. Adversarialität bezeichnet die gegnerische Konstruktion der Eingabe und kann beide Fälle umfassen.3 Ein GCG-Suffix entsteht durch diskrete Optimierung und fällt häufig durch ungewöhnliche Tokenmuster auf. AutoDAN steht für eine andere Klasse: Die Methode sucht nach semantisch lesbaren Prompts und zeigt damit, dass sprachliche Natürlichkeit keine Entwarnung ist.2

Für die Sicherheitsbewertung genügt daher nicht die Frage, ob ein Text „verdächtig aussieht“. Relevant sind Herkunft, angenommene Fähigkeiten des Angreifers, Anschlussrechte des Modells und die Wirkung im Gesamtsystem. Eine bösartige Formulierung ohne Zugriff auf Daten oder Werkzeuge kann ein Qualitätsproblem sein; dieselbe Formulierung in einem agentischen Ablauf mit weitreichenden Berechtigungen kann zu einem Sicherheitsereignis führen.3

Dokumentiertes Beispiel

Die Arbeit von Zou und Kollegen dokumentierte automatisch konstruierte universelle Suffixe, die an unterschiedliche Anfragen angefügt wurden. Die Autoren trainierten diese auf offenen Modellen und berichteten anschließend Übertragbarkeit auf mehrere weitere Modelle sowie öffentliche Schnittstellen. Das Beispiel belegt nicht, dass jedes Modell in jeder Konfiguration gleich reagiert; es zeigt jedoch, dass Schutz durch nicht veröffentlichte Modellgewichte allein keine belastbare Sicherheitsgrenze darstellt.1

AutoDAN dokumentiert die Gegenklasse. Der hierarchische genetische Ansatz wurde entwickelt, um automatisch erzeugte Prompts semantisch sinnvoll zu halten, und die Autoren vergleichen ihn ausdrücklich mit auffälligen tokenbasierten Angriffen sowie perplexitätsbasierten Filtern.2 Für ein Glossar ist diese Gegenüberstellung wichtiger als die Rekonstruktion einzelner Eingaben: Sie trennt zwei analytisch verschiedene Angriffsflächen.

Bedeutung für die Abwehr

Abwehr beginnt mit einer klaren Daten- und Vertrauensgrenze: Fremdinhalte bleiben Daten, Anweisungen erhalten eine definierte Priorität, und Werkzeugrechte werden außerhalb des Modells begrenzt. Ein Perplexitäts-Filter kann auffällige Optimierungssuffixe ergänzend erkennen, ist aber keine allgemeine Erkennung adversarialer Sprache. OWASP weist ausdrücklich darauf hin, dass es für Prompt Injection keine narrensichere Prävention gibt und dass Vertrauensgrenzen, Zugriffskontrollen sowie adversariale Tests zusammenwirken müssen.3

Quellen

  1. Andy Zou et al., „Universal and Transferable Adversarial Attacks on Aligned Language Models“, 27. Juli 2023, https://arxiv.org/abs/2307.15043.
  2. Xiaogeng Liu et al., „AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models“, 3. Oktober 2023, https://arxiv.org/abs/2310.04451.
  3. OWASP Gen AI Security Project, „LLM01:2026 Prompt Injection“, 3. August 2026, https://genai.owasp.org/resource/owasp-genai-llm-top-10-2026/.