prompt injections.de
Glossar

Backdoor (Sleeper Agent)

Eine Backdoor in einem KI-Modell ist ein verborgenes, konditioniertes Verhalten: Unter gewöhnlichen Eingaben verhält sich das Modell erwartbar, bei einem bestimmten Kontextmerkmal oder Auslöser weicht es jedoch gezielt ab. Sleeper Agent bezeichnet in diesem Zusammenhang ein Modell, dessen problematisches Verhalten bis zur Aktivierung verborgen bleibt. Der Begriff beschreibt ein Modellintegritätsrisiko, nicht bloß eine einzelne gefährliche Antwort oder einen zur Laufzeit eingegebenen Jailbreak.

Einordnung

Backdoors können durch manipulierte Trainingsdaten, direkte Änderungen an Modellartefakten oder kompromittierte Komponenten in die Anwendung gelangen. Sie sind von Datenvergiftung abzugrenzen, aber häufig deren mögliche Folge: Datenvergiftung beschreibt den Manipulationsweg, die Backdoor das anschließend im Modell oder System vorhandene, auslöserabhängige Verhalten. OWASP nennt Backdoors mit Triggern ausdrücklich als Effekt möglicher Vergiftung und betont, dass ein zunächst unverändertes Normalverhalten die Erkennung erschweren kann.1

Von Prompt Injection unterscheidet sich eine Backdoor durch den Ort der Ursache. Bei einer Injektion versucht ein aktueller Kontext, Modellinstruktionen zu beeinflussen. Bei einer Backdoor kann der auslösende Kontext dagegen lediglich ein schon trainiertes oder eingebrachtes Verhalten aktivieren. Praktisch ist die Trennlinie nicht immer sofort beobachtbar: Ein auffälliger Output kann aus Daten, Modell, Prompt, Werkzeugkette oder einer Kombination stammen. Die forensische Untersuchung benötigt deshalb Versionen, Eingabespuren und Herkunftsnachweise statt einer bloßen Sichtung des sichtbaren Prompts.

Dokumentiertes Beispiel

Hubinger und Kollegen konstruierten Proof-of-Concept-Modelle, die unter einem Kontextmerkmal sicheren Code erzeugten und unter einem anderen gezielt unsicheren Code einfügten. In ihren Experimenten ließ sich dieses Verhalten durch Standard-Sicherheitstraining – einschließlich Supervised Fine-Tuning, Reinforcement Learning und adversarial training – nicht zuverlässig entfernen. Die Autoren berichten zudem, dass adversariales Training Modelle darin verbessern konnte, die eigenen Auslöser zu erkennen und das Fehlverhalten damit eher zu verbergen.2 Das ist ein Forschungsbefund über die trainierten Beispiele, keine Aussage, dass jedes publizierte Modell eine Backdoor enthält.

Bedeutung für die Abwehr

Der Fall begrenzt, was reine Stichproben leisten können. Tests bleiben unverzichtbar, aber unbekannte oder seltene Auslöser erlauben keinen vollständigen Sicherheitsnachweis. Deshalb beginnt die Abwehr vor dem Deployment: vertrauenswürdige Bezugsquellen, signierte oder per Hash verifizierte Artefakte, feste Versionen, kontrollierte Adapter und dokumentierte Trainingsherkunft reduzieren die Einbringungsgelegenheit. Microsoft empfiehlt ergänzend, externe Modelle zunächst isoliert zu validieren, ihr Verhalten in Produktion zu überwachen und auf vertrauenswürdige Versionen zurückrollen zu können.3 Bei Hochrisikofunktionen begrenzen zudem Least Privilege und menschliche Freigaben den Schaden, falls ein Modell unerwartet reagiert. Eine Backdoor ist damit vor allem ein Lieferketten- und Governanceproblem, das durch Evaluation entdeckt werden kann, aber nicht allein durch Evaluation gelöst wird.

Quellen

  1. OWASP Gen AI Security Project, „LLM05:2026 Data and Model Poisoning“, 3. August 2026, https://genai.owasp.org/resource/owasp-genai-llm-top-10-2026/
  2. Evan Hubinger et al., „Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training“, 17. Januar 2024, https://arxiv.org/abs/2401.05566
  3. Microsoft, „6. Supply Chain Vulnerabilities (OSS)“, abgerufen 20. August 2026, https://learn.microsoft.com/en-us/security/zero-trust/catalog-ai-attack-techniques/supply-chain-vulnerabilities