Mensch in der Schleife (Human in the Loop)
Mensch in der Schleife, international Human in the Loop (HITL), bezeichnet eine Sicherheitskontrolle, bei der ein Mensch eine Aktion eines KI-Systems vor ihrer Ausführung prüfen und genehmigen oder ablehnen kann. Im Agentenkontext ist HITL keine allgemeine Aufsicht über jedes Modellwort, sondern eine gezielte Autorisierungsstufe vor wirkungsstarken, schwer rückgängig zu machenden oder externen Handlungen.1
Einordnung
HITL adressiert vor allem die Folgen einer fehlerhaften oder manipulierten Modellentscheidung. Es verhindert eine Prompt Injection nicht zuverlässig: Ein kompromittierter Agent kann weiterhin eine falsche Aktion vorbereiten. Die Kontrolle kann aber verhindern, dass diese Aktion tatsächlich versendet, veröffentlicht, gelöscht oder ausgelöst wird. Deshalb gehört HITL zur Begrenzung von Excessive Agency und ergänzt Least Privilege sowie serverseitige Berechtigungsprüfung. OWASP nennt übermäßige Funktionalität, Berechtigungen und Autonomie als Ursachen, durch die unerwartete oder manipulierte LLM-Ausgaben schädliche Handlungen auslösen können.1
Die Wirksamkeit hängt von der Qualität der Entscheidungsvorlage ab. Eine Freigabeoberfläche muss die tatsächlich auszuführende Operation, Ziel, Umfang und wesentliche Parameter wiedergeben, nicht nur die beruhigende Zusammenfassung des Modells. Das MCP-Protokoll empfiehlt ausdrücklich, vor sensiblen Operationen Tool-Eingaben anzuzeigen, um bösartige oder unbeabsichtigte Datenexfiltration zu vermeiden.2 Ebenso wichtig ist Selektivität: Bei jeder banalen Aktion nach Bestätigung zu fragen, erzeugt Routinen und verschiebt die Verantwortung faktisch zurück zum System. HITL ist daher keine Ausrede für unpräzise Werkzeuge oder überprivilegierte Agenten.
Dokumentiertes Beispiel
Die OWASP-Risikobeschreibung zu LLM06 illustriert das Problem anhand eines Mail-Assistenten, der E-Mails nur zusammenfassen soll, aber auch Versandfunktionen besitzt. In Verbindung mit indirekter Prompt Injection könnte ein solcher Agent Inhalte aus einem Postfach weiterleiten; OWASP nennt als Gegenmaßnahme unter anderem eine manuelle Prüfung und das explizite Auslösen des Versands durch den Nutzer.1 Die aktuelle MCP-Toolspezifikation geht in dieselbe Richtung: Sie empfiehlt sichtbare Hinweise auf Tool-Aufrufe und Bestätigungsdialoge, damit ein Mensch Aufrufe verweigern kann.2
Bedeutung für die Abwehr
Eine gute HITL-Regel ist risikobasiert. Bestätigung ist sinnvoll etwa vor externem Versand, Änderungen produktiver Daten, kostenpflichtigen Vorgängen, Rechteänderungen oder Offenlegung sensibler Informationen. Die Freigabe sollte an die konkrete Aktion gebunden sein und nach einer Änderung wesentlicher Parameter verfallen. NIST beschreibt „Human-AI Configuration“ als eigenständigen Risikobereich generativer KI, zu dem Übervertrauen und Automation Bias zählen; das spricht gegen rein dekorative Bestätigungen.3 Wirksam wird die Kontrolle erst im Zusammenspiel mit enger Tool-Funktionalität, eindeutiger Darstellung und einer vom Modell unabhängigen Policy-Prüfung. Wo eine Aktion durch Berechtigungen technisch ausgeschlossen ist, muss ein Mensch sie nicht regelmäßig wegklicken.
Quellen
- OWASP Foundation, „LLM03:2026 Excessive Agency“, 3. August 2026, https://genai.owasp.org/resource/owasp-genai-llm-top-10-2026/. ↩
- Model Context Protocol Contributors, „Tools“, 28. Juli 2026, https://modelcontextprotocol.io/specification/2026-07-28/server/tools. ↩
- National Institute of Standards and Technology, „Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile (NIST AI 600-1)“, Juli 2024, https://nvlpubs.nist.gov/nistpubs/ai/NIST.AI.600-1.pdf. ↩