prompt injections.de
Glossar

Unicode-Tag-Zeichen

Unicode-Tag-Zeichen sind Zeichen aus dem Bereich U+E0000 bis U+E007F, die in vielen Oberflächen nicht als lesbarer Text erscheinen. Sie können ASCII-ähnliche Informationen zusätzlich zu sichtbarem Text transportieren und dadurch die Wahrnehmung eines Menschen von der tatsächlichen Zeichenfolge trennen. Im Kontext von LLM-Sicherheit sind sie eine spezielle Form der Obfuskation, nicht eine allgemeine Eigenschaft jedes Unicode-Texts.1

Einordnung

Das Sicherheitsproblem entsteht an Übergängen: Ein Nutzer, Redakteur oder Monitoring-System sieht möglicherweise nur den sichtbaren Anteil einer Eingabe, während eine andere Komponente die vollständige Zeichenfolge verarbeitet. Cisco dokumentierte 2024, dass Unicode-Tag-Zeichen für verdeckte Prompt-Injection-Inhalte missbraucht werden können, und verwies auf das Risiko bei kopiertem Inhalt sowie bei indirekter Prompt Injection.1 Anders als ein Homoglyph verändert ein Tag-Zeichen nicht primär den visuellen Eindruck eines sichtbaren Buchstabens. Es ergänzt oder maskiert vielmehr Inhalt, der in der Darstellung häufig fehlt. Die Technik ist damit vor allem ein Integritätsproblem für Textaufnahme, Prüfung und Weitergabe.

Dokumentiertes Beispiel

Der Cisco-Bericht geht auf eine im Januar 2024 öffentlich demonstrierte Technik ein und beschreibt, dass die Tag-Sequenzen dem menschlichen Auge unsichtbar bleiben können. Als mögliche Folgen nennt er versteckte Anweisungen in externen Quellen, unbeabsichtigtes Kopieren durch Menschen und eine unvollständige Verarbeitung durch Sicherheits- oder Monitoring-Systeme.1 Zugleich hält der Bericht fest, dass für eine breite Ausnutzung außerhalb von Sicherheitsforschung damals wenig belastbare Evidenz vorlag. Diese Einschränkung ist wichtig: Ein dokumentierter Proof of Concept belegt eine Klasse von Risiken, nicht automatisch einen verbreiteten realen Vorfall. Der Unicode-Sicherheitsstandard führt „Default Ignorable Code Points“ zudem als für sicherheitsrelevante Identifier zu beschränkende Zeichenklasse.2

Bedeutung für die Abwehr

Annahme und Weitergabe von Text sollten Codepunkte prüfen, bevor Inhalt in Prompt, Speicher, Retrieval, Protokoll oder Oberfläche gelangt. Für Felder, die keine Emoji-Flaggen oder spezialisierte Unicode-Tag-Nutzung benötigen, ist das Erkennen und Entfernen des Tag-Bereichs eine eng begrenzte, gut begründbare Regel; jeder Treffer sollte nachvollziehbar markiert werden.1 Die Entscheidung muss fachlich dokumentiert sein, weil eine pauschale Bereinigung den Originaltext verändert. Ergänzend braucht es eine Darstellung, die verdächtige Steuer- und Formatzeichen sichtbar macht, sowie Tests entlang des gesamten Pfads von Import bis Modellantwort. Diese Regel allein genügt nicht: OWASP ordnet Unicode-Smuggling neben weiteren Kodierungs- und Obfuskationsformen ein. Schutz entsteht daher erst aus Normalisierung, Kontextprüfung und einer Architektur, in der nicht vertrauenswürdige Inhalte keine Berechtigungen erzeugen.3

Quellen

  1. Adam Swanda, Cisco, „Understanding and Mitigating Unicode Tag Prompt Injection“, 12. März 2024, https://blogs.cisco.com/ai/understanding-and-mitigating-unicode-tag-prompt-injection
  2. Unicode Consortium, „UTS #39: Unicode Security Mechanisms“, Version 17.0.0, 4. September 2025, https://www.unicode.org/reports/tr39/
  3. OWASP Cheat Sheet Series, „LLM Prompt Injection Prevention Cheat Sheet“, laufend aktualisiert, abgerufen am 20. August 2026, https://cheatsheetseries.owasp.org/cheatsheets/LLM_Prompt_Injection_Prevention_Cheat_Sheet.html