Multimodales Modell
Ein multimodales Modell verarbeitet mehr als eine Modalität, etwa Text zusammen mit Bildern oder Audiodaten, und verknüpft diese Eingaben bei der Ausgabeerzeugung. Für die Sicherheit ist entscheidend, dass Bild- oder Audiosignale nicht nur Anschauungsmaterial sein können: Werden sie vom Modell semantisch verarbeitet, können sie dessen Verhalten ebenso beeinflussen wie textlicher Kontext.1
Einordnung
Multimodalität ist keine Schwachstelle an sich. Sie erweitert aber die Angriffsfläche einer Anwendung, weil jede zugelassene Modalität einen zusätzlichen Weg für unzuverlässige oder manipulativ gestaltete Inhalte in den Modellkontext eröffnet. Von Prompt Injection ist erst zu sprechen, wenn ein solcher Inhalt das Verhalten unbeabsichtigt vom vorgesehenen Auftrag weglenkt; ein Bild mit normalem Informationsgehalt ist dafür kein Beleg. Diese Abgrenzung verhindert, dass jede Fehlklassifikation oder jede inhaltlich falsche Bildbeschreibung vorschnell als Injektion etikettiert wird.
Textbasierte Eingabefilter reichen in diesem Umfeld nicht als alleinige Schutzschicht. OWASP hält fest, dass Eingaben ein Modell auch beeinflussen können, wenn sie für Menschen nicht wahrnehmbar sind, solange das Modell sie verarbeitet, und verweist ausdrücklich auf neuartige modalitätsübergreifende Risiken.2 Der relevante Prüfgegenstand ist deshalb die vollständige Verarbeitungskette: Annahme der Datei, Umwandlung oder Extraktion, Modellsicht auf den Inhalt, nachgelagerte Werkzeuge und mögliche Ausgaben an andere Systeme.
Dokumentiertes Beispiel
Bagdasaryan, Hsieh, Nassi und Shmatikov zeigten 2023 in einer Forschungsarbeit indirekte Instruktionsinjektion über Bilder und Audiosignale. In ihren Proofs of Concept beeinflussten adversarial veränderte Medien bei ansonsten benignen Nutzeranfragen die Ausgabe oder den Folgedialog der untersuchten LLaVA- und PandaGPT-Systeme.1 Eine verwandte Arbeit zu visuellen adversarialen Beispielen beschrieb zudem, dass visuelle Eingaben bei visionintegrierten Sprachmodellen eine zusätzliche Angriffsfläche darstellen und demonstrierte die Umgehung von Sicherheitsleitplanken in einem Forschungsszenario.3 Beides sind Forschungsnachweise, keine Aussage über die identische Verwundbarkeit jedes heutigen Produkts.
Bedeutung für die Abwehr
Die Abwehr muss modalitätsspezifisch erfolgen. Betreiber sollten für Text, Bild, Audio und Video jeweils festlegen, ob die Modalität benötigt wird, welche Transformationen sie durchläuft und welche Rechte ein daraus abgeleiteter Modelloutput auslösen darf. Unvertraute Inhalte sind als Daten, nicht als Anweisungen zu behandeln; besonders bei Werkzeugaufrufen begrenzen geringe Berechtigungen und menschliche Freigaben die Folgen fehlerhafter Interpretation.2 Wiederholte Tests sollten die Aufgabentreue und die Wirkung entlang realer Medienpfade prüfen. So wird aus „multimodal“ kein pauschales Risikoetikett, sondern ein überprüfbarer Teil des Bedrohungsmodells für Prompt Injection.
Quellen
- Eugene Bagdasaryan, Tsung-Yin Hsieh, Ben Nassi und Vitaly Shmatikov, „Abusing Images and Sounds for Indirect Instruction Injection in Multi-Modal LLMs“, 3. Oktober 2023, https://arxiv.org/abs/2307.10490. ↩
- OWASP Foundation, „LLM01:2026 Prompt Injection“, 3. August 2026, https://genai.owasp.org/resource/owasp-genai-llm-top-10-2026/. ↩
- Xiangyu Qi et al., „Visual Adversarial Examples Jailbreak Aligned Large Language Models“, 16. August 2023, https://arxiv.org/abs/2306.13213. ↩