AutoDAN
AutoDAN bezeichnet einen Forschungsansatz zur automatisierten Erzeugung sprachlich unauffälliger Jailbreak-Prompts. Statt primär unlesbare Tokenfolgen zu suchen, verwendet AutoDAN einen hierarchischen genetischen Algorithmus, der die semantische Sinnhaftigkeit der Kandidaten erhalten soll. Damit beschreibt der Begriff eine konkrete Angriffs- und Testmethode, nicht jede höflich oder glaubwürdig formulierte Prompt Injection.1
Einordnung
AutoDAN gehört zur Klasse adversarialer Eingaben, grenzt sich aber von GCG-Suffixen durch sein Optimierungsziel ab. GCG optimiert diskrete Tokens direkt; AutoDAN kombiniert Selektion und Variation von Promptbestandteilen mit einem Ziel, das zugleich Angriffswirkung und sprachliche Unauffälligkeit berücksichtigt. Diese Unauffälligkeit ist sicherheitsrelevant, weil sie die Annahme widerlegt, gefährliche Eingaben seien zuverlässig an kryptischen Zeichenmustern erkennbar.1
Der Name sollte nicht dazu verleiten, jede Überredungstechnik als AutoDAN zu klassifizieren. Maßgeblich ist die automatisierte, genetische Suche des beschriebenen Verfahrens. Ebenso wenig ist ein in einer Studie berichteter Erfolg mit einer allgemeinen Aussage über Modelle, Sprachräume oder produktive Anwendungen gleichzusetzen. Die Originalarbeit bewertet konkrete Modelle und Baselines; ihre Ergebnisse dienen als Beleg für eine Angriffsklasse, nicht als Messwert für die Sicherheit eines beliebigen Dienstes.1
Dokumentiertes Beispiel
Liu und Kollegen stellten AutoDAN 2023 vor und veröffentlichten eine revidierte Fassung als ICLR-2024-Beitrag. Nach ihrem Evaluierungsbericht automatisiert der Ansatz die Erzeugung semantisch sinnvoller Prompts und erzielte gegenüber den geprüften Baselines stärkere modellübergreifende Übertragbarkeit sowie sampleübergreifende Universalität.1 Das dokumentierte Beispiel ist gerade deshalb für die Abwehr nützlich: Es zeigt, dass eine Evaluierung nur mit zufällig erzeugtem Rauschen oder bekannten Suffixen einen falschen Sicherheitskomfort erzeugen kann.
Die Autoren vergleichen AutoDAN zudem mit perplexitätsbasierten Abwehrmethoden und berichten, dass ihre erzeugten Eingaben diese in den untersuchten Versuchen wirksam umgehen konnten.1 Das bestätigt eine ältere Erkennungsstudie nicht pauschal als widerlegt: Alon und Kamfonas untersuchten speziell adversariale Suffixe, fanden dort hohe Perplexität, warnten aber bereits vor Fehlalarmen einfacher Schwellenwerte.2
Bedeutung für die Abwehr
Für Schutzmaßnahmen folgt eine klare Testanforderung: Tokenauffällige und flüssig formulierte adversariale Eingaben müssen getrennt erfasst werden. Ein Filter, der eine Klasse gut erkennt, ist nicht automatisch gegen die andere robust. Sinnvoll sind daher semantische und kontextbezogene Prüfungen, eine restriktive Werkzeugautorisierung und die Begrenzung sensibler Datenausgaben. OWASP empfiehlt ausdrücklich mehrschichtige Kontrollen und adversariale Tests, statt eine einzelne Erkennungsmethode als vollständige Prävention zu behandeln.3
Quellen
- Xiaogeng Liu et al., „AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models“, 3. Oktober 2023, https://arxiv.org/abs/2310.04451. ↩
- Gabriel Alon und Michael Kamfonas, „Detecting Language Model Attacks with Perplexity“, 27. August 2023, https://arxiv.org/abs/2308.14132. ↩
- OWASP Gen AI Security Project, „LLM01:2026 Prompt Injection“, 3. August 2026, https://genai.owasp.org/resource/owasp-genai-llm-top-10-2026/. ↩