prompt injections.de
Glossar

Alignment

Alignment bezeichnet die Ausrichtung eines KI-Modells auf festgelegte Zielwerte, etwa Hilfsbereitschaft, Wahrhaftigkeit oder die Vermeidung schädlicher Antworten. Bei Sprachmodellen wird diese Ausrichtung typischerweise durch Nachtraining mit Beispielen, Präferenzurteilen und Sicherheitsvorgaben verstärkt.1 Alignment ist damit eine Eigenschaft des wahrscheinlichen Modellverhaltens unter bestimmten Bedingungen, keine formale Zugriffskontrolle.

Einordnung

Für die Sicherheit von LLM-Anwendungen ist die Abgrenzung zentral: Alignment beeinflusst, welche Antwort ein Modell voraussichtlich erzeugt; es entscheidet nicht verlässlich, welche Daten, Werkzeuge oder Geschäftsvorgänge eine Anwendung freigibt. Ein ausgerichtetes Modell kann eine problematische Inhaltsanfrage verweigern und dennoch eine fremde Anweisung aus einem Dokument als aufgabenrelevant behandeln. In diesem Fall kann eine Prompt Injection die Aufgabenausführung verschieben, ohne dass zwingend eine offensichtliche Inhaltsrichtlinie verletzt wird.

Das InstructGPT-Paper beschreibt Alignment als Annäherung an Nutzerintentionen. Es zeigt, dass menschliches Feedback Antworten kleinerer Modelle gegenüber einem erheblich größeren Basismodell in den untersuchten menschlichen Bewertungen bevorzugt machen kann; zugleich hält es fest, dass die trainierten Modelle weiterhin einfache Fehler machen.1 Diese Kombination ist die richtige Lesart: Nachtraining kann Risiken und Fehlverhalten verringern, liefert aber keine ausnahmslose Regelbefolgung.

Von RLHF unterscheidet sich Alignment als Zielbegriff: RLHF ist eine verbreitete Methode, um dieses Ziel zu verfolgen. Von einer Policy- oder Rechteprüfung unterscheidet sich Alignment dadurch, dass es kein separater Durchsetzungsmechanismus ist. Die Grenzen werden besonders deutlich, wenn unzuverlässige externe Inhalte in den Modellkontext gelangen oder ein Modell Werkzeuge mit weitreichenden Berechtigungen ansteuern kann.

Dokumentiertes Beispiel

Ouyang et al. trainierten InstructGPT zunächst mit menschlich vorgegebenen Demonstrationen und anschließend mit Rangordnungen von Modellantworten. Die Arbeit berichtet Verbesserungen bei Wahrhaftigkeit und eine Verringerung toxischer Ausgaben, ohne einen vollständigen Fehlerausschluss zu behaupten.1 Das Beispiel dokumentiert eine Verhaltensverbesserung durch Nachtraining, nicht die Durchsetzung einer Sicherheitsgarantie.

OWASP weist ergänzend darauf hin, dass Fine-Tuning und RAG Prompt-Injection-Schwachstellen nicht vollständig beseitigen.2 Für die Anwendungssicherheit folgt daraus: Die Widerstandsfähigkeit gegen fremde Anweisungen darf nicht allein aus einer behaupteten Modell-Ausrichtung abgeleitet werden.

Bedeutung für die Abwehr

Alles, was garantiert gelten muss, gehört außerhalb der Modellentscheidung. Dazu zählen Berechtigungsprüfungen, zulässige Werkzeugaktionen, Datenfreigaben und die Validierung von Ausgaben vor einer wirksamen Handlung. Alignment bleibt dennoch wertvoll: Es senkt die Zahl unerwünschter Antworten und verbessert die Qualität vorgelagerter Entscheidungen. Es ist jedoch eine zusätzliche Schicht im Schutz, nicht dessen tragendes Fundament.

Quellen

  1. Long Ouyang et al., „Training language models to follow instructions with human feedback“, 2022, https://proceedings.neurips.cc/paper_files/paper/2022/hash/b1efde53be364a73914f58805a001731-Abstract.html
  2. OWASP GenAI Security Project, „LLM01:2026 Prompt Injection“, 3. August 2026, https://genai.owasp.org/resource/owasp-genai-llm-top-10-2026/