prompt injections.de
Glossar

Obfuskation

Obfuskation ist die absichtliche Verschleierung einer Anweisung oder eines Datenfragments, ohne dessen beabsichtigte Bedeutung notwendig zu verlieren. Im Umfeld von LLMs nutzt sie Unterschiede zwischen Darstellung, Zeichenverarbeitung, Filterlogik und semantischer Interpretation aus. Sie ist keine eigenständige Schadwirkung, sondern eine Umgehungstechnik, die etwa eine Prompt Injection oder einen Jailbreak weniger auffällig machen soll.1

Einordnung

Typische Varianten verändern die Form einer Zeichenfolge durch Kodierungen, ungewöhnliche Leerzeichen, Unicode-Eigenschaften, Schreibvarianten oder eingebettete Darstellungsebenen. Entscheidend ist nicht, ob ein Text für Menschen schwer lesbar ist, sondern ob vorgelagerte Prüfungen und das nachfolgende Modell denselben Inhalt unterschiedlich behandeln. OWASP nennt Kodierung und Obfuskation ausdrücklich als Prompt-Injection-Muster und führt unter anderem Zeichenkodierungen sowie Unicode-Smuggling als Risikoklassen auf.1 Obfuskation unterscheidet sich damit von Homoglyph: Homoglyphen sind eine engere Unicode-Technik der visuellen Verwechslung, während Obfuskation der Oberbegriff für Veränderungen ist, die Erkennung und Bedeutungsverarbeitung auseinanderziehen.

Dokumentiertes Beispiel

Cisco beschrieb 2024 eine Unicode-Tag-basierte Verschleierung, bei der für Menschen nicht sichtbare Zeichen in Eingaben eingebettet waren. Der Bericht ordnet sie als Variante ein, die besonders bei indirekter Prompt Injection und kopiertem Fremdinhalt relevant ist, weil menschliche Prüfung, Monitoring und nachgelagerte Modellverarbeitung unterschiedlich reagieren können.2 Die NeurIPS-Arbeit von Wei, Haghtalab und Steinhardt liefert den breiteren Forschungskontext: Safety-Training kann an konkurrierenden Zielen und an unpassender Generalisierung scheitern; reine Oberflächenregeln sind daher kein ausreichendes Schutzmodell.3 Das konkrete Auftreten einzelner Kodierungsformen ist folglich ein Testfall für die gesamte Verarbeitungskette, nicht lediglich für eine Wortliste.

Bedeutung für die Abwehr

Abwehr beginnt an der Systemgrenze: Eingaben und übernommene Fremdinhalte werden vor der Klassifikation in eine nachvollziehbare Normalform überführt, unsichtbare oder in der jeweiligen Anwendung unzulässige Zeichen werden erkannt und die ursprüngliche sowie bereinigte Fassung werden revisionsfähig protokolliert.1 Normalisierung ist aber kein Allheilmittel; sie kann legitime Schreibweisen verändern und erreicht nicht jede semantische Umschreibung. Deshalb braucht sie klar durchgesetzte Daten-/Instruktionsgrenzen, eindeutige Herkunftsmarkierung für jedes Fragment, Prüfungen für RAG-Dokumente und Tool-Ausgaben, Ausgabemonitoring sowie strikt begrenzte Berechtigungen.1 In kontrollierten Red-Team-Tests sollte dieselbe Sicherheitsentscheidung für Klartext, erlaubte Formatvarianten und relevante Unicode-Fälle stabil bleiben. Ein Filter, der nur eine exakte Zeichenfolge erkennt, belegt keine belastbare Abwehr gegen Obfuskation.

Quellen

  1. OWASP Cheat Sheet Series, „LLM Prompt Injection Prevention Cheat Sheet“, laufend aktualisiert, abgerufen am 20. August 2026, https://cheatsheetseries.owasp.org/cheatsheets/LLM_Prompt_Injection_Prevention_Cheat_Sheet.html
  2. Adam Swanda, Cisco, „Understanding and Mitigating Unicode Tag Prompt Injection“, 12. März 2024, https://blogs.cisco.com/ai/understanding-and-mitigating-unicode-tag-prompt-injection
  3. Alexander Wei, Nika Haghtalab und Jacob Steinhardt, „Jailbroken: How Does LLM Safety Training Fail?“, NeurIPS 2023, https://proceedings.neurips.cc/paper_files/paper/2023/hash/fd6613131889a4b656206c50a8bd7790-Abstract-Conference.html