LLM-as-a-Judge
LLM-as-a-Judge bezeichnet ein Verfahren, bei dem ein Sprachmodell die Qualität, Regelkonformität oder Sicherheit einer Antwort bewertet. Es kann offene Ergebnisse nach einer Rubrik einstufen, Antworten vergleichen oder ein strukturiertes Urteil erzeugen. Der Ansatz macht Evaluationen skalierbar, ersetzt aber nicht die Prüfung, ob der bewertende Kontext selbst manipuliert wurde.1
Einordnung
Der Judge ist kein neutraler Parser. Er verarbeitet die zu bewertende Antwort im selben sprachlichen Modus wie jede andere Eingabe und kann daher auf Formulierung, Reihenfolge und Inhalt reagieren. Zheng et al. untersuchen LLM-as-a-Judge für offene Aufgaben und benennen Positions-, Ausführlichkeits- und Selbstpräferenzverzerrungen sowie begrenzte Schlussfolgerungsfähigkeit als bekannte Einschränkungen.1 Diese Befunde betreffen die Zuverlässigkeit der Bewertung auch ohne Gegner.
Bei Prompt Injection kommt eine weitere Ebene hinzu: Der Bewertungsgegenstand kann instruktionsartige Inhalte enthalten. Das Risiko ist nicht nur eine falsche Klassifikation, sondern eine Veränderung der Bewertungslogik selbst. Ein Judge, der den zu prüfenden Text als Autorität statt als Daten behandelt, kann ein manipuliertes Urteil als Grundlage für Freigaben, Guardrails oder Benchmark-Werte liefern. LLM-as-a-Judge ist deshalb weder gleichbedeutend mit einem deterministischen Policy-Check noch mit einem spezialisierten Klassifikator. Seine Stärke liegt in semantischer Beurteilung offener Fälle; genau diese Fähigkeit vergrößert seine Abhängigkeit von einer sauberen Vertrauensgrenze.
Dokumentiertes Beispiel
Unit 42 veröffentlichte Ende 2024 die Technik „Bad Likert Judge“. Die Analyse beschreibt einen mehrstufigen Jailbreak, der die Bewertungsrolle eines Zielmodells und eine Ratingskala missbraucht; die Autoren testeten den Ansatz gegen sechs anonymisierte Textgenerierungsmodelle.2 Für die Architekturlehre ist entscheidend, dass eine Bewertungsaufgabe nicht automatisch eine sichere Aufgabe ist: Ein Modell kann durch die Rolle „beurteile“ in die Verarbeitung von Inhalten gezogen werden, die es außerhalb dieser Rolle anders behandeln müsste. Der Fall ist ein dokumentierter Angriff auf die Bewertungsfähigkeit eines Modells, keine Empfehlung zur Reproduktion.
Bedeutung für die Abwehr
Der zu bewertende Text muss technisch als Datenobjekt eingegrenzt sein. Dazu gehören feste Eingabefelder, eine voneinander getrennte Rubrik, ein enges Ausgabeschema und deterministische Validierung der Rückgabe. Der Judge sollte keine Werkzeuge besitzen und keine Rechte aus seinem Urteil ableiten; eine Folgeregel prüft stattdessen nur erwartete Werte und Grenzen. Für hochwirksame Entscheidungen empfiehlt sich zusätzlich Stichprobenprüfung durch Menschen oder ein unabhängiger Kontrollpfad. In einer Guardrail-Kette ist das Judge-Urteil ein Signal, nicht der alleinige Vertrauensanker. Wer das Ergebnis protokolliert, muss deshalb Promptversion, Bewertungsrubrik, Modellversion und den vollständigen, als Daten gekennzeichneten Prüfausschnitt festhalten.
Quellen
- Lianmin Zheng et al., „Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena“, 24. Dezember 2023, https://arxiv.org/abs/2306.05685 ↩
- Yongzhe Huang et al., „Bad Likert Judge: A Novel Multi-Turn Technique to Jailbreak LLMs by Misusing Their Evaluation Capability“, 31. Dezember 2024, https://unit42.paloaltonetworks.com/multi-turn-technique-jailbreaks-llms/ ↩