Perplexitäts-Filter
Ein Perplexitäts-Filter bewertet, wie gut ein Sprachmodell die Token einer Eingabe vorhersagt. Hohe Perplexität bedeutet vereinfacht: Die Tokenfolge ist für das verwendete Bewertungsmodell statistisch unerwartet. In der Prompt-Injection-Abwehr wird das als Hinweis auf maschinell optimierte, ungewöhnliche Suffixe genutzt; Perplexität misst jedoch weder Absicht noch Berechtigung eines Textes.1
Einordnung
Der Filter ist eine Erkennungsheuristik und kein Policy-Interpreter. Er entscheidet nicht verlässlich, ob eine Eingabe eine Anweisung, ein Datenobjekt oder ein legitimer Spezialfall wie Quellcode, Protokollauszug oder mehrsprachiger Text ist. Deshalb muss ein Perplexitätswert immer im Kontext des konkreten Bewertungsmodells, der Tokenisierung, der Sprache und des zulässigen Eingabespektrums gelesen werden. Die Studie von Alon und Kamfonas zeigt diese Grenze ausdrücklich: Bei regulären Promptvarianten waren Fehlalarme für eine reine Perplexitätsschwelle ein erhebliches Problem.1
Das Verfahren ist besonders eng mit GCG-Suffixen verbunden. Solche Optimierungen können ungewöhnliche Tokenmuster erzeugen und damit auffallen. Die Abwehrstudie von Jain und Kollegen unterscheidet deshalb perplexitätsbasierte Detektion von Vorverarbeitung und adversarialem Training; sie bewertet diese Ansätze in verschiedenen White-Box- und Gray-Box-Szenarien und diskutiert Robustheits-Nutzwert-Abwägungen.2 Ein guter Messwert für eine Angriffsfamilie wird dadurch nicht zu einem allgemeinen Nachweis sicherer Eingaben.
Dokumentiertes Beispiel
Alon und Kamfonas berechneten die Perplexität adversarialer Suffixanfragen mit GPT-2 und fanden in ihrer Untersuchung sehr hohe Werte. Zugleich stellten sie bei vielfältigen harmlosen Prompts relevante Fehlalarme fest. Ein Klassifikator auf Basis von Perplexität und Tokenlänge erkannte im verwendeten Testsatz die meisten adversarialen Eingaben besser als eine reine Schwellenwertregel.1 Das dokumentiert einen Nutzen als statistisches Signal, aber keine übertragbare Blockiergarantie.
AutoDAN verdeutlicht die Gegenprobe: Die Autoren beschreiben absichtlich semantisch sinnvolle Prompts und berichten ein Umgehen perplexitätsbasierter Abwehr in ihrer Evaluation.3 Zusammen belegen die Arbeiten, dass der Filter nicht nach „bösartig“ sortiert, sondern nach statistischer Auffälligkeit. Diese Differenz ist für die Betriebsentscheidung zentral.
Bedeutung für die Abwehr
In einer Schutzarchitektur eignet sich Perplexität deshalb für risikoorientiertes Routing: ungewöhnliche Eingaben können in eine strengere Prüfspur, eine begrenzte Funktionsvariante oder eine protokollierte Teststichprobe gelangen. Die Schwelle muss mit repräsentativen, zulässigen Eingaben der jeweiligen Anwendung kalibriert werden; sie sollte weder aus einer fremden Studie übernommen noch als alleinige Sperre eingesetzt werden. Ergänzend bleiben Guardrails, Datenkennzeichnung, minimale Rechte und ausgabeseitige Kontrollen erforderlich.2
Quellen
- Gabriel Alon und Michael Kamfonas, „Detecting Language Model Attacks with Perplexity“, 27. August 2023, https://arxiv.org/abs/2308.14132. ↩
- Neel Jain et al., „Baseline Defenses for Adversarial Attacks Against Aligned Language Models“, 1. September 2023, https://arxiv.org/abs/2309.00614. ↩
- Xiaogeng Liu et al., „AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models“, 3. Oktober 2023, https://arxiv.org/abs/2310.04451. ↩