prompt injections.de
Glossar

Prompt-Infektion

Eine Prompt-Infektion ist eine Form der Prompt Injection, deren Inhalt darauf angelegt ist, von einem empfangenden Agenten an weitere Agenten weitergegeben zu werden. Die Besonderheit ist die Selbstreplikation entlang von Kommunikationswegen: Aus einer lokalen Manipulation kann dadurch ein Problem des gesamten Multi-Agenten-Systems werden.1

Einordnung

Klassische direkte und indirekte Prompt Injections verändern die Modellverarbeitung in einer einzelnen Interaktion. Prompt-Infektion erweitert dieses Grundmuster um Propagation: Ein manipuliertes Artefakt wird nicht nur interpretiert, sondern als Teil einer Übergabe an nachgelagerte Agenten fortgeschrieben. Der Begriff ist daher näher an der Ausbreitungslogik eines Computerwurms als an einem einzelnen Jailbreak, ohne mit Schadsoftware gleichgesetzt werden zu dürfen. Der Payload ist Text oder multimodaler Kontext in einem LLM-Workflow; die Verbreitung hängt von Agentenrollen, Speichern, Zusammenfassungen und Übergaberegeln ab.1

Die Reichweite ist nicht allein eine Modellfrage. Sie steigt, wenn Agenten viele Verbindungen besitzen, automatisch Zwischenergebnisse teilen oder denselben Arbeitsspeicher verwenden. Sie sinkt, wenn Systeme fremde Inhalte eindeutig als Daten kennzeichnen, Quelleninformationen erhalten und Ergebnisse nicht als Instruktionen übernehmen. Das ist eine Konkretisierung der allgemeinen Prompt-Injection-Lage: OWASP unterscheidet direkte von indirekten Injections und betont, dass externe Inhalte das Verhalten eines LLM ungewollt verändern können.2 Prompt-Infektion ist damit ein Spezialfall indirekter bzw. LLM-zu-LLM-vermittelter Injektion, nicht die Bezeichnung für jede fehlerhafte Agentenantwort.

Dokumentiertes Beispiel

Die ursprüngliche Arbeit von Lee und Tiwari wurde am 9. Oktober 2024 auf arXiv veröffentlicht und beschreibt Prompt Infection als selbstreplizierende LLM-zu-LLM-Prompt-Injection in verbundenen Agentensystemen. Die Autoren berichten Experimente, in denen die Infektion sich auch dann ausbreiten konnte, wenn Agenten nicht ihre gesamte Kommunikation öffentlich teilten.1 Die begutachtete Fassung erschien 2026 im Umfeld der ESORICS-Workshops und beschreibt Datenweitergabe und Selbstreplikation als die Merkmale, die den Angriff über herkömmliche Prompt Injection hinausheben.3 Das dokumentiert eine Forschungsbedrohung, nicht eine veröffentlichte Serienkompromittierung eines bestimmten Produkts.

Bedeutung für die Abwehr

Eine belastbare Abwehr behandelt jede Übergabe als Protokoll, nicht als freien Prompt. Agenten sollten strukturierte Felder für Befunde, Quellen, Unsicherheit und Handlungsauftrag verwenden; nur ausdrücklich autorisierte Workflow-Elemente dürfen als Instruktion gelten. Untrusted Text wird damit nicht durch eine Formulierung „sicher“, sondern verliert die Fähigkeit, Privilegien oder Aufgaben zu erweitern. Ergänzend begrenzen getrennte Rollen, Laufzeitgrenzen und Mensch in der Schleife bei folgenreichen Aktionen den möglichen Schaden.2 Die in der Forschung vorgeschlagene Kennzeichnung von LLM-Inhalten kann die Ausbreitung zusätzlich erschweren, ersetzt aber weder Berechtigungskontrollen noch Prüfung an den Übergängen.1

Quellen

  1. Donghyun Lee und Mo Tiwari, „Prompt Infection: LLM-to-LLM Prompt Injection within Multi-Agent Systems“, 9. Oktober 2024, https://arxiv.org/abs/2410.07283.
  2. OWASP Foundation, „LLM01:2026 Prompt Injection“, 3. August 2026, https://genai.owasp.org/resource/owasp-genai-llm-top-10-2026/.
  3. Donghyun Lee, Mo Tiwari und Brando Miranda, „Prompt Infection: LLM-to-LLM Prompt Injection within Multi-agent Systems“, 1. Mai 2026, https://link.springer.com/chapter/10.1007/978-3-032-16092-8_28.