prompt injections.de
Glossar

SecAlign

SecAlign ist ein trainingsbasierter Abwehransatz gegen Prompt Injection in Sprachmodellen. Für einen prompt-injizierten Eingabekontext erhält das Modell nicht nur die erwünschte Antwort auf die legitime Aufgabe, sondern auch eine als unerwünscht markierte Antwort, die der eingeschleusten Anweisung folgt; eine Präferenzoptimierung soll die erstere systematisch bevorzugen.1 Damit adressiert SecAlign die Modellrobustheit, nicht die Berechtigungen oder Nebenwirkungen der umgebenden Anwendung.

Einordnung

Anders als reine Prompt-Hierarchien oder Eingabefilter verlagert SecAlign die Trennung von Anweisung und fremdem Dateninhalt teilweise in das Modellverhalten. Der Ansatz ist mit /glossar/struq/ verwandt, weil beide gegen dieselbe Verwechslung von Daten und Instruktion trainieren. Seine zentrale Differenz liegt im Lernziel: StruQ optimiert auf eine gewünschte Antwort, während SecAlign ein Paar aus sicherer und unsicherer Antwort nutzt. Nach Aussage der Autoren soll das Modell dadurch nicht nur lernen, was es tun soll, sondern auch, welche Reaktion auf die Injektion zu vermeiden ist.1 Das ist eine empirische Härtung und keine Zugriffskontrolle: Ein erfolgreich gehärtetes Modell kann weiterhin einen Funktionsaufruf vorschlagen, den eine Anwendung nicht hätte zulassen dürfen.

Dokumentiertes Beispiel

Chen und Mitautoren evaluierten SecAlign auf fünf Modellen gegen drei optimierungsfreie sowie drei optimierungsbasierte Angriffsfamilien. Für die optimierungsfreien Tests berichten sie durchgängig null Prozent Angriffserfolg; bei den stärkeren optimierungsbasierten Tests lag die Erfolgsrate überwiegend unter zehn Prozent und laut Paper um mehr als den Faktor vier unter StruQ.1 Diese Zahlen sind Resultate eines bestimmten Benchmarks, von Modellen und einer Angriffsdefinition, nicht die Zusage einer allgemeinen Immunität. Gerade deshalb ist die Untersuchung als Vergleichsmessung zu lesen: Sie zeigt, dass das Präferenzziel in dieser Evaluation besser generalisierte als die geprüften Alternativen, nicht dass eine Injektion in jeder Produktumgebung wirkungslos wäre. Die Autoren haben Trainings- und Evaluierungsskripte als Referenzimplementierung veröffentlicht.2

Bedeutung für die Abwehr

SecAlign ist vor allem ein Baustein für Betreiber, die Gewichte selbst feinabstimmen oder ein entsprechend trainiertes Modell auswählen können. Im Sicherheitsentwurf ergänzt es /schutz/: Der Nutzen besteht darin, die Wahrscheinlichkeit zu senken, dass fremder Kontext die Aufgabeninterpretation kippt. Es ersetzt weder eng begrenzte Werkzeugrechte noch eine serverseitige Prüfung von Ausgaben und Funktionsaufrufen. Für die Beschaffung ist daher die präzise Frage sinnvoll, gegen welche indirekten Injektionen, Modelle, Datenquellen und adaptiven Tests eine behauptete Härtung gemessen wurde. Ohne diese Angaben ist „gegen Prompt Injection trainiert“ keine belastbare Aussage über das Restrisiko eines konkreten Agenten.

Quellen

  1. Sizhe Chen et al., „SecAlign: Defending Against Prompt Injection with Preference Optimization“, 3. Juli 2025, https://arxiv.org/html/2410.05451v3
  2. Meta/Facebook Research, „SecAlign: Reference implementation“, undatiert, https://github.com/facebookresearch/SecAlign