prompt injections.de
Glossar

Kontextvergiftung

Kontextvergiftung bezeichnet die Manipulation eines Gesprächs-, Arbeits- oder Datenkontexts, sodass spätere Modellantworten von einer vorgegebenen, unzutreffenden oder sicherheitswidrigen Prämisse beeinflusst werden. Die Wirkung liegt in der Folge und Verknüpfung mehrerer Inhalte, nicht notwendig in einer einzelnen klar erkennbaren Eingabe. Sie ist deshalb besonders relevant für Systeme mit langen Sitzungen, gespeichertem Gedächtnis, Retrieval oder Werkzeugausgaben.1

Einordnung

Der Begriff beschreibt einen Mechanismus, keine einzelne Promptform. In einem Dialog kann der relevante Kontext aus früheren Nutzer- und Modellnachrichten bestehen; in einem RAG-System kann er aus abgerufenen Dokumenten oder Tool-Ergebnissen stammen. OWASP führt mehrstufige und persistente Angriffe sowie RAG-Poisoning getrennt auf, weil die Injektionsquelle unterschiedlich sein kann, während das gemeinsame Risiko die Übernahme nicht vertrauenswürdiger Anweisungen in den Verarbeitungskontext ist.2 Kontextvergiftung ist damit von Trainingsdatenvergiftung abzugrenzen: Letztere verändert Daten vor oder während des Modelltrainings, erstere den Kontext einer laufenden Anwendung. Sie kann die Grundlage für Techniken wie Echo Chamber bilden, ist aber nicht auf diesen spezifischen Jailbreak beschränkt.

Dokumentiertes Beispiel

Die 2026 veröffentlichte Vorveröffentlichung zu Echo Chamber beschreibt Multi-Turn-Jailbreaks als gezielt konstruierte Interaktionsketten mit einem Chatbot und führt Echo Chamber als graduell eskalierende Methode ein.1 NeuralTrust hatte die Technik bereits 2025 als kontextvergiftenden Jailbreak beschrieben und in eigenen kontrollierten Tests untersucht. Der Anbieter betont dabei, dass isoliert harmlose Beiträge zusammengenommen eine riskante Gesprächsrichtung erzeugen können.3 Diese Dokumentation ist kein Nachweis, dass jede Verlaufsverarbeitung unsicher ist; sie belegt jedoch, dass eine Einzelnachrichtenprüfung das Angriffsziel verfehlen kann, wenn sie die Entstehung eines problematischen Kontexts nicht bewertet.

Bedeutung für die Abwehr

Die Abwehr muss die Herkunft und Rolle jedes Kontextteils sichtbar machen: Systemanweisung, verifizierte Anwendungsdaten, Nutzerinhalt, abgerufener Fremdtext und Tool-Ausgabe dürfen nicht als gleich vertrauenswürdige Instruktionen behandelt werden.2 Praktisch gehören dazu begrenzte Kontextfenster und Sitzungsdauern, Zurücksetzen nach Abschluss einer Aufgabe, getrennte Speicherbereiche sowie eine Freigabeprüfung vor jeder sensitiven Aktion. Kontextbewusste Prüfung bewertet zusätzlich den Gesprächsverlauf, etwa eine ungewöhnliche Zielverschiebung, wiederholte indirekte Bezugnahmen oder wachsende Risikoindikatoren.3 Keine solche Heuristik ist ein Ersatz für Autorisierung: Selbst wenn vergifteter Kontext das Modell überzeugt, dürfen Tools nur im Umfang der bestätigten Nutzerrechte und der ursprünglich freigegebenen Aufgabe handeln. Tests sollten deshalb ganze Abläufe mit vertrauensfremden Dokumenten, langen Dialogen und Reset-Grenzen abdecken.2

Quellen

  1. Ahmad Alobaid et al., „The Echo Chamber Multi-Turn LLM Jailbreak“, 9. Januar 2026, https://arxiv.org/abs/2601.05742
  2. OWASP Cheat Sheet Series, „LLM Prompt Injection Prevention Cheat Sheet“, laufend aktualisiert, abgerufen am 20. August 2026, https://cheatsheetseries.owasp.org/cheatsheets/LLM_Prompt_Injection_Prevention_Cheat_Sheet.html
  3. NeuralTrust, „Echo Chamber: A Context-Poisoning Jailbreak That Bypasses LLM Guardrails“, 23. Juni 2025, https://neuraltrust.ai/blog/echo-chamber-context-poisoning-jailbreak