SecAlign
SecAlign ist ein Forschungsansatz zur modellseitigen Abwehr von Prompt Injection. Er stammt aus einer Zusammenarbeit von UC Berkeley und Meta FAIR und trainiert ein Sprachmodell darauf, bei konflikthaften Eingaben die Antwort auf die legitime Aufgabe gegenüber der Antwort auf eine eingeschleuste Anweisung zu bevorzugen.1 Das Verfahren ist daher keine vorgeschaltete Erkennungskomponente, sondern eine nachträgliche Härtung eines modifizierbaren Modells.1
Funktionsweise
Die Trainingsdaten bestehen aus Tripeln: einem Eingabetext mit eingebetteter Anweisung, einer gewünschten Antwort auf die legitime Instruktion und einer unerwünschten Antwort auf die eingebettete Instruktion.1 SecAlign optimiert diese Paare mittels Direct Preference Optimization (DPO), also mit einem Lernziel, das den Wahrscheinlichkeitsabstand zwischen gewünschter und unerwünschter Antwort vergrößert.1 Damit ergänzt der Ansatz die bei StruQ eingesetzte überwachte Feinabstimmung um ein explizites negatives Vergleichsbeispiel. Die Autor:innen begründen dies damit, dass das bloße Verstärken einer korrekten Antwort bei der großen Menge möglicher Modellantworten nicht notwendig zugleich die Wahrscheinlichkeit einer konkreten falschen Antwort senkt.1
Zum Entwurf gehört außerdem ein „Secure Front-End“. Es formatiert vertrauenswürdige Instruktion und unzuverlässige Daten mit reservierten Trennmarken und entfernt diese Marken aus den Daten, bevor sie das Modell erreichen.2 Die Härtung ist damit an die gesamte Eingabekette gebunden: Ein Modell, das auf diese Struktur trainiert wurde, sollte nicht mit ungefilterten oder anders formatierten Dokumenten betrieben werden. Der Ansatz schützt folglich nicht die Zugriffsrechte, Werkzeugaufrufe oder Datenabflüsse einer Anwendung; solche Kontrollen bleiben eine eigenständige Schicht des Schutzes.
Einsatz in der Praxis
Das offizielle Repository ist Forschungssoftware, keine gehostete API und kein Laufzeit-Plugin. Es enthält Trainings- und Testskripte, optional herunterladbare LoRA-Adapter sowie Konfigurationen für Mistral-7B-Instruct und Llama-3-8B-Instruct; die dokumentierte Trainingsumgebung verlangt vier 80-GB-A100-GPUs.3 Praktisch ist SecAlign daher für Teams mit Zugang zu Modellgewichten, eigener Feinabstimmungsinfrastruktur und Kontrolle über Prompt-Template sowie Ingestion geeignet. Für Anwendungen, die ausschließlich ein fremdes Modell per API konsumieren, lässt sich die Methode nicht nachträglich auf dessen Gewichte anwenden.3
Einen versionierten Stable Release gibt es nicht: Der offizielle Release-Endpunkt war am Stichtag leer, während die Repository-Metadaten das Projekt als öffentlich und nicht archiviert ausweisen und den letzten Push am 2. Juli 2026 nennen.4 Die Entwicklungslinie wurde zudem durch das gesonderte Forschungsprojekt „Meta SecAlign“ fortgeführt, das eine erweiterte SecAlign++-Rezeptur und Modelle mit zusätzlicher Rolle für unzuverlässige Eingaben beschreibt. Das ist ein separates Modell- und Codeangebot, nicht eine Versionsnummer des ursprünglichen SecAlign-Repositories.5
Grenzen
Die im Originalpaper berichteten niedrigen Angriffserfolgsraten sind Ergebnisse der Autor:innen unter deren Versuchsaufbau und keine Sicherheitsgarantie. Das Paper setzt für seine starken Optimierungstests White-Box-Zugriff auf das Zielmodell voraus und misst vor allem, ob das Modell der eingeschleusten statt der legitimen Instruktion folgt.1 Eine unabhängige Untersuchung aus dem Dezember 2025 konstruierte in einem White-Box-Szenario architekturbezogene Optimierungsangriffe und berichtete für SecAlign-Varianten hohe Erfolgsraten bei erweitertem Tokenbudget.6 Eine weitere Arbeit fand mit Checkpoint-GCG ebenfalls hohe Erfolgsraten, setzt dafür jedoch Zugriff auf Zwischenstände des Fine-Tunings voraus; sie ist deshalb als anspruchsvoller Audit-Befund, nicht als direkte Aussage über jeden Black-Box-Einsatz, einzuordnen.7
Hinzu kommt ein Messproblem: Ein niedriger Angriffserfolg belegt nicht automatisch, dass instruktionsähnlicher Text als Daten korrekt verarbeitet wurde. SecFid bewertet genau diese Unterscheidung und fand für getestete SecAlign-Varianten eine Sicherheits-Fidelity-Abwägung; hohe gemessene Nichtausführung konnte mit dem Unterdrücken eigentlich aufgabenrelevanten Textes einhergehen.8 Für Übersetzung, Editierung oder Extraktion sollte eine eigene Qualitäts- und Robustheitsprüfung daher Teil der Einführung sein.
Lizenz und Bezug
Der Quellcode steht unter Creative Commons Attribution–NonCommercial 4.0 International (CC BY-NC 4.0). Die Lizenz erlaubt Vervielfältigung, Weitergabe und Bearbeitung nur für nicht-kommerzielle Zwecke und verlangt Attribution sowie Lizenzhinweise.9 Einen Anbieterpreis oder kommerziellen Support veröffentlicht das Forschungsrepository nicht; für produktive Nutzung sind deshalb neben der nicht-kommerziellen Lizenz die jeweiligen Bedingungen des Basismodells, der Trainingsdaten und weiterer Abhängigkeiten gesondert zu prüfen.9
Quellen
- Chen et al., „SecAlign: Defending Against Prompt Injection with Preference Optimization“, 13.01.2025, https://arxiv.org/html/2410.05451v2 ↩
- Berkeley AI Research, „Defending against Prompt Injection with Structured Queries (StruQ) and Preference Optimization (SecAlign)“, 11.04.2025, https://bair.berkeley.edu/blog/2025/04/11/prompt-injection-defense/ ↩
- Meta, „facebookresearch/SecAlign – README“, abgerufen am 20.08.2026, https://github.com/facebookresearch/SecAlign ↩
- GitHub, „facebookresearch/SecAlign – Repository metadata and releases“, abgerufen am 20.08.2026, https://api.github.com/repos/facebookresearch/SecAlign und https://api.github.com/repos/facebookresearch/SecAlign/releases ↩
- Chen et al., „Meta SecAlign: A Secure Foundation LLM Against Prompt Injection Attacks“, 06.02.2026, https://arxiv.org/html/2507.02735 ↩
- Pandya et al., „May I have your Attention? Breaking Fine-Tuning based Prompt Injection Defenses using Architecture-Aware Attacks“, 17.12.2025, https://arxiv.org/html/2507.07417 ↩
- „Checkpoint-GCG: Auditing and Attacking Fine-Tuning-Based Prompt Injection Defenses“, 16.10.2025, https://arxiv.org/html/2505.15738 ↩
- Hermon et al., „Security–Fidelity Tradeoffs: The Hidden Cost of Prompt Injection Defense“, 29.06.2026, https://arxiv.org/html/2606.30783 ↩
- Meta, „SecAlign LICENSE: Creative Commons Attribution–NonCommercial 4.0 International“, abgerufen am 20.08.2026, https://raw.githubusercontent.com/facebookresearch/SecAlign/main/LICENSE ↩