prompt injections.de
Glossar

GCG-Suffix

Ein GCG-Suffix ist eine durch Greedy Coordinate Gradient (GCG) berechnete Tokenfolge, die an eine Anfrage angehängt wird, um die Wahrscheinlichkeit eines bestimmten Modellverhaltens zu erhöhen. Es ist kein natürlichsprachlicher Befehl im üblichen Sinn, sondern das Ergebnis einer diskreten Optimierung über mögliche Tokenpositionen. In der Sicherheitsliteratur steht GCG deshalb exemplarisch für maschinell erzeugte adversariale Suffixangriffe.1

Einordnung

GCG ist eine konkrete Methode innerhalb der adversarialen Eingaben, nicht deren Oberbegriff. Das Verfahren kombiniert eine Gradienteninformation aus dem untersuchten Modell mit einer gierigen Auswahl von Tokenkandidaten. Die erzeugte Folge wird auf ein Optimierungsziel ausgerichtet, etwa auf eine bestätigende statt verweigernde Modellantwort. Daraus folgt weder, dass jedes unverständliche Textfragment ein GCG-Suffix ist, noch dass jede Prompt Injection mit GCG arbeitet.1

Die Forschungsrelevanz liegt in der Übertragbarkeit. Zou und Kollegen trainierten Suffixe auf mehreren offenen Vicuna-Modellen und berichten, dass diese auch auf andere offene Modelle und damalige öffentliche Modellzugänge wirkten. Die Befunde zeigen ein Transferproblem zwischen Modellfamilien; sie sind keine zeitlose Erfolgsquote und keine Aussage über aktuelle Produktkonfigurationen.1 Gegenüber AutoDAN unterscheidet sich GCG vor allem durch die Optimierungsform und die oft geringere sprachliche Lesbarkeit, nicht durch das abstrakte Ziel der Fehlsteuerung.2

Dokumentiertes Beispiel

Als dokumentierter Forschungsfall genügt der Aufbau der Originalarbeit: Ein universelles Suffix wurde über viele problematische Zielanfragen und Modelle optimiert und anschließend in weiteren Modellumgebungen evaluiert. Die Autoren berichteten erfolgreiche Übertragungen auf mehrere Systeme, die nicht zur Optimierung verwendet wurden.1 Für die Praxis folgt daraus ein Prüfauftrag, keine Anleitung: Ein Red Team sollte Eingaben mit algorithmisch optimierten Merkmalen als eigene Testklasse führen und Ergebnisse strikt nach Modell, Version, Promptvorlage und angeschlossenen Werkzeugen protokollieren.

Jain und Kollegen untersuchten GCG-artige adversariale Angriffe in einem breiteren Vergleich und ordneten Perplexitätserkennung, Eingabevorverarbeitung und adversariales Training als unterschiedliche Abwehrklassen ein. Ihre Arbeit macht deutlich, dass die Wirksamkeit von Bedrohungsmodell und Angriffskonfiguration abhängt.3

Bedeutung für die Abwehr

Ein GCG-Suffix ist für Perplexitäts-Filter besonders relevant, weil optimierte Tokenfolgen statistisch auffällig sein können. Alon und Kamfonas fanden für adversariale Suffixe in ihrer Untersuchung sehr hohe Perplexitätswerte, zugleich aber erhebliche Fehlalarme bei einer reinen Schwellenwertregel.2 Daher ist eine solche Prüfung ein Signal zur Behandlung, nicht der Sicherheitsbeweis selbst. Zusätzlich begrenzen eine robuste Gegenprüfung gegen AutoDAN, minimale Werkzeugrechte und ausgabeseitige Kontrollen den Schaden, falls ein Filter umgangen wird.3

Quellen

  1. Andy Zou et al., „Universal and Transferable Adversarial Attacks on Aligned Language Models“, 27. Juli 2023, https://arxiv.org/abs/2307.15043.
  2. Gabriel Alon und Michael Kamfonas, „Detecting Language Model Attacks with Perplexity“, 27. August 2023, https://arxiv.org/abs/2308.14132.
  3. Neel Jain et al., „Baseline Defenses for Adversarial Attacks Against Aligned Language Models“, 1. September 2023, https://arxiv.org/abs/2309.00614.