Constitutional Classifiers
Constitutional Classifiers sind separate Klassifikatoren, die Eingaben und/oder Ausgaben eines Sprachmodells anhand explizit formulierter Inhaltsregeln bewerten. Die Regeln – die „Constitution“ – definieren erlaubte und eingeschränkte Inhaltsklassen; aus ihnen abgeleitete synthetische Daten dienen dem Training der Schutzmodelle.1 Sie sind damit eine Laufzeitschicht neben dem eigentlichen generativen Modell, nicht bloß ein weiteres Alignment-Training.
Einordnung
Der zentrale Unterschied zu Constitutional AI liegt in der Architektur. Constitutional AI prägt das Antwortverhalten beim Nachtraining. Constitutional Classifiers prüfen dagegen, ob eine Anfrage oder Ausgabe nach einer vorgegebenen Policy auffällig oder unzulässig ist, und können sie blockieren, bevor ein Modell antwortet oder bevor eine Ausgabe weiterverwendet wird. Dadurch lassen sich Regelinhalt und Prüfkomponente getrennt versionieren und testen.
Die Schicht ist allerdings kein universeller Ersatz für Zugriffskontrolle. Ein Klassifikator beurteilt Inhalt und Kontext, während eine Berechtigungskomponente prüfen muss, ob ein konkreter Nutzer eine konkrete Aktion auslösen darf. Ebenso benötigen Werkzeugaufrufe eigene Parameter- und Kontextvalidierung. Der Vorteil der Trennung besteht darin, dass Sicherheitsregeln nicht allein in der Wahrscheinlichkeit einer Modellantwort liegen, sondern in einer zweiten Entscheidungsebene geprüft werden.
Dokumentiertes Beispiel
Die Facharbeit von Sharma et al. beschreibt Klassifikatoren, die aus einer in natürlicher Sprache formulierten Constitution und daraus erzeugten synthetischen Daten trainiert werden. In über 3.000 geschätzten Stunden Red Teaming fand nach Darstellung der Autoren niemand einen universellen Jailbreak, der aus einem frühen geschützten System für die meisten Zielanfragen ähnlich detaillierte Informationen wie aus einem ungeschützten Modell gewann.1 Dieser Befund gilt für die dort getestete Konfiguration und ist keine allgemeine Zusage, dass Classifier alle Jailbreaks verhindern.
Zum Stand August 2026 berichtet Anthropic eine Weiterentwicklung namens Constitutional Classifiers++. Sie kombiniert eine günstige Vorprüfung mit einer stärkeren Eskalationsprüfung und benennt zugleich nach zusätzlichen adversarialen Tests verbleibende Angriffskategorien.2 Die Quelle meldet für ihre Evaluierung mehr als 1.700 Red-Teaming-Stunden und keinen gefundenen universellen Jailbreak; auch das bleibt ein hersteller- und zeitgebundener Messbefund.2
Bedeutung für die Abwehr
Constitutional Classifiers sind sinnvoll, wenn eine Anwendung eine explizite, testbare Policy-Schicht zwischen untrusted content, Modell und Werkzeugen benötigt. Ihre Wirksamkeit hängt von Regelabdeckung, Datenqualität, Fehlalarmen, Latenz und fortlaufender Evaluation ab. Sie sollten mit Guardrails, Least Privilege und einer kontrollierten Ausführung kombiniert werden. Die defensiv relevante Kennzahl ist nicht die behauptete Unknackbarkeit, sondern die reproduzierbar gemessene Verbesserung gegen einen klar beschriebenen Testsatz.
Quellen
- Mrinank Sharma et al., „Constitutional Classifiers: Defending against Universal Jailbreaks across Thousands of Hours of Red Teaming“, 31. Januar 2025, https://arxiv.org/abs/2501.18837 ↩
- Anthropic, „Next-generation Constitutional Classifiers: More efficient protection against universal jailbreaks“, 9. Januar 2026, https://www.anthropic.com/research/next-generation-constitutional-classifiers ↩