RLHF
RLHF steht für Reinforcement Learning from Human Feedback. Das Verfahren nutzt menschliche Präferenzurteile über Modellantworten, um ein Belohnungsmodell und anschließend das Verhalten eines Sprachmodells auf erwünschte Antworten auszurichten.1 RLHF ist somit ein Nachtrainingsverfahren für Verhaltensneigungen, keine Zugriffsentscheidung über Daten oder Werkzeuge.
Einordnung
Der übliche Ablauf besteht aus mehreren Stufen. Zunächst wird ein vortrainiertes Modell mit menschlichen Demonstrationen überwacht feinabgestimmt. Danach bewerten Personen mehrere Modellantworten vergleichend; aus diesen Rangordnungen wird ein Präferenz- oder Belohnungsmodell abgeleitet, dessen Signal im Reinforcement Learning die weitere Optimierung steuert.1 Die Optimierung belohnt Antworten, die in den abgebildeten Bewertungssituationen den Präferenzen der Bewertenden entsprechen.
Das erklärt die Stärke und die Grenze des Begriffs. RLHF kann ein Modell hilfreicher, weniger toxisch oder eher wahrheitsgemäß machen, weil die gewünschte Antwortform im Training häufiger belohnt wird. Es ist aber keine Policy Engine: Das Verfahren verleiht dem Modell keine logisch harte Trennung zwischen vertrauenswürdigen Anweisungen und untrusted content. Besonders bei mehrdeutigem Kontext, Rollenwechseln oder fremden Dokumenten kann die gelernte Präferenz anders aktiviert werden als im Trainingsfall.
Alignment bezeichnet das übergeordnete Ziel; RLHF ist ein Weg dorthin. Davon abzugrenzen ist RLAIF (Reinforcement Learning from AI Feedback): Bei Constitutional AI bewertet ein Modell Antworten anhand expliziter Prinzipien und liefert damit das Präferenzsignal für das Reinforcement Learning.2 Beide Ansätze optimieren Verhalten statistisch, unterscheiden sich aber in der Herkunft des Feedbacks.
Dokumentiertes Beispiel
InstructGPT verwendete zunächst von Bewertenden verfasste Demonstrationen für überwachtes Fine-Tuning und danach Rangordnungen von Modellantworten für RLHF. In den menschlichen Bewertungen der Arbeit wurden Antworten eines 1,3-Milliarden-Parameter-InstructGPT-Modells gegenüber denen von GPT-3 mit 175 Milliarden Parametern bevorzugt; die Autoren berichten zudem Verbesserungen bei Wahrhaftigkeit und toxischen Ausgaben.1 Der Befund zeigt, dass Präferenztraining Modellverhalten deutlich beeinflussen kann, nicht aber, dass es jede problematische Antwort ausschließt.
Constitutional AI illustriert die methodische Nachbarschaft: Dort erzeugt das System Selbstkritiken und Überarbeitungen; in der RL-Phase dient ein aus KI-Präferenzen trainiertes Modell als Belohnungssignal.2 RLHF und RLAIF sind deshalb nicht austauschbare Namen, sondern Varianten einer gemeinsamen Optimierungsfamilie.
Bedeutung für die Abwehr
RLHF sollte als Reduktion von Fehlerraten behandelt werden. Anwendungen benötigen zusätzlich Rechtebegrenzung, Werkzeugvalidierung und unabhängige Kontrollen, wenn Fehlverhalten Folgen außerhalb des Chatfensters haben kann. Für Techniken der Prompt Injection ist entscheidend, dass eine gute Ablehnungsneigung nicht beweist, dass eine Anwendung fremde Kontexte korrekt als Daten statt als Anweisungen behandelt.
Quellen
- Long Ouyang et al., „Training language models to follow instructions with human feedback“, 2022, https://proceedings.neurips.cc/paper_files/paper/2022/hash/b1efde53be364a73914f58805a001731-Abstract.html ↩
- Anthropic, „Constitutional AI: Harmlessness from AI Feedback“, 15. Dezember 2022, https://www.anthropic.com/research/constitutional-ai-harmlessness-from-ai-feedback ↩