Constitutional AI
Constitutional AI ist ein Nachtrainingsansatz, bei dem ein schriftlich festgelegter Katalog von Prinzipien die Bewertung und Überarbeitung von Modellantworten leitet. In der ursprünglichen Beschreibung erzeugt ein Modell Selbstkritiken und Revisionen; anschließend werden Präferenzen mithilfe eines weiteren Modells entlang dieser Prinzipien bewertet und für Reinforcement Learning genutzt.1 Der Ansatz macht die normativen Vorgaben expliziter als rein implizite Präferenzdaten.
Einordnung
Die „Constitution“ ist keine technische Verfassung im rechtlichen Sinn und auch kein Regelwerk, das jedes Modellverhalten deterministisch blockiert. Sie ist eine Liste ausformulierter Leitprinzipien, an denen ein Modell im Trainingsprozess Antworten kritisieren und überarbeiten soll. Der dokumentierte Ablauf umfasst eine überwachte Phase mit Selbstkritik und Revision sowie eine RL-Phase mit Reinforcement Learning from AI Feedback (RLAIF).1
Damit steht Constitutional AI zwischen zwei Nachbarbegriffen. Gegenüber RLHF verschiebt sich ein Teil der Bewertungsarbeit von menschlichen Einzelrangordnungen zu KI-Feedback, das an vorgegebenen Prinzipien ausgerichtet wird. Gegenüber Alignment ist Constitutional AI nicht das Ziel, sondern eine konkrete Trainingsmethode. Seine Stärke liegt in der Nachvollziehbarkeit der Prinzipienauswahl: Regeln können dokumentiert, überprüft und geändert werden, bevor sie als Feedbackmaßstab dienen.
Diese Transparenz ist jedoch nicht mit Durchsetzung gleichzusetzen. Die Prinzipien beeinflussen, was das Modell eher produziert; sie ersetzen weder Berechtigungsprüfungen noch eine Validierung von Werkzeugaufrufen. Ein System kann sich beim Antworten an Prinzipien orientieren und trotzdem unzuverlässigen Kontext falsch einordnen oder eine zulässige, aber für den konkreten Nutzer unberechtigte Aktion anstoßen.
Dokumentiertes Beispiel
Anthropic beschreibt, dass die ursprüngliche Methode ohne menschliche Labels auskommt, die schädliche Ausgaben einzeln kennzeichnen. Die menschliche Aufsicht liegt in der bereitgestellten Liste von Regeln oder Prinzipien; daraus werden Selbstkritiken, überarbeitete Antworten und im weiteren Verlauf KI-Präferenzen abgeleitet.1 Das ist ein dokumentiertes Trainingsdesign, keine Aussage über die Fehlerfreiheit eines produktiven Systems.
Die Abgrenzung zur Laufzeitabsicherung zeigt sich bei Constitutional Classifiers: Diese Schutzschicht trainiert separate Klassifikatoren aus natürlichen Sprachregeln und prüft Eingaben beziehungsweise Ausgaben. Sie ist zwar prinzipienbasiert, aber architektonisch nicht dasselbe wie Constitutional AI.2
Bedeutung für die Abwehr
Für Betreiber ist der übertragbare Nutzen die explizite Regelarbeit. Sicherheitsrelevante Prinzipien sollten schriftlich, versioniert und testbar vorliegen, statt nur als vage Systemanweisung zu existieren. Die Umsetzung erfordert dennoch ergänzende Constitutional Classifiers, Rechtekontrollen und Red Teaming. Constitutional AI verbessert die Modellneigung; die Schutzarchitektur muss entscheiden, welche Handlungen das System tatsächlich ausführen darf.
Quellen
- Anthropic, „Constitutional AI: Harmlessness from AI Feedback“, 15. Dezember 2022, https://www.anthropic.com/research/constitutional-ai-harmlessness-from-ai-feedback ↩
- Mrinank Sharma et al., „Constitutional Classifiers: Defending against Universal Jailbreaks across Thousands of Hours of Red Teaming“, 31. Januar 2025, https://arxiv.org/abs/2501.18837 ↩