prompt injections.de
Glossar

Token

Ein Token ist eine numerisch codierte Einheit, in die ein Tokenizer Eingabetext zerlegt und die ein Sprachmodell als Folge verarbeitet. Ein Token ist weder zuverlässig ein vollständiges Wort noch ein einzelnes Zeichen: Byte-Pair-Encoding (BPE) bildet häufige Teilwörter bevorzugt als wiederkehrende Einheiten ab.1 Die Grenzen sind daher eine Eigenschaft des konkreten Tokenizers, nicht der menschlichen Rechtschreibung.

Einordnung

Für die Prompt Injection ist diese Differenz relevant, weil zwischen dem vom Menschen gelesenen Text, einer vorgelagerten Prüfung und der vom Modell verarbeiteten Tokenfolge mehrere Darstellungen liegen können. OWASP weist ausdrücklich darauf hin, dass Eingaben nicht für Menschen lesbar sein müssen, sofern sie vom Modell verarbeitet werden.2 Ein Token ist dabei nicht selbst eine Schwachstelle und auch kein Synonym für einen Prompt. Der Begriff beschreibt die Repräsentationsebene; die Sicherheitsfrage lautet, ob Schutzkontrollen dieselbe, kanonisch aufbereitete Eingabe bewerten wie die nachfolgenden Verarbeitungsschritte.

Der verbreitete Satz, ein Token entspreche „einem Wort“, ist deshalb nur eine grobe Kosten- oder Längenheuristik. Tiktoken beschreibt BPE als reversibel und verlustfrei für den zugrunde liegenden Text; zugleich komprimiert die Codierung und kann Teilwörter voneinander trennen.1 Für Sicherheitsanalysen sind Tokenzahlen daher keine Inhaltsklassifikation. Sie helfen bei Kontextbudgets und Anomaliebeobachtung, belegen aber weder Harmlosigkeit noch Angriffsabsicht.

Dokumentiertes Beispiel

Daniel und Pal untersuchten 2024 fünfzehn Sprachmodelle mit 38 standardisierten Anfragen und analysierten dabei auch nichtstandardisierte Unicode-Zeichen. Die Autoren berichten, dass solche Zeichen in ihrem Versuchsaufbau die Wirksamkeit der getesteten RLHF-Guardrails reduzierten und die Anfälligkeit für Policy-Verstöße sowie Prompt-Leaks erhöhte.3 Das ist kein Beleg dafür, dass jedes Modell denselben Text „trotzdem versteht“ oder dass jede Prüfung nur Zeichenketten vergleicht. Es belegt jedoch, dass die Transformation zwischen sichtbarer Zeichenfolge, Kodierung und Modellverarbeitung als Angriffsfläche empirisch untersucht wurde.

Bedeutung für die Abwehr

Robuste Schutzmaßnahmen behandeln Eingabetext vor Prüfung und Modellübergabe konsistent: Unicode kanonisieren, nicht darstellbare oder unsichtbare Steuerzeichen nach einer begründeten Policy behandeln und Original sowie normalisierte Fassung revisionsfähig protokollieren. Die Policy muss sprachliche Anforderungen und legitime Mehrsprachigkeit berücksichtigen; pauschales Löschen aller nicht-ASCII-Zeichen wäre keine verlässliche Sicherheitsstrategie. Zusätzlich sollten Tests Tokenizer- und Modellwechsel abdecken. Entscheidend ist nicht, eine angenommene Tokenfolge zu erraten, sondern Abweichungen zwischen Eingabekontrolle, Retrieval und Modellkontext zu vermeiden.

Quellen

  1. OpenAI, „tiktoken“, laufende Fassung, abgerufen am 20. August 2026, https://github.com/openai/tiktoken
  2. OWASP, „LLM01:2026 Prompt Injection“, 3. August 2026, https://github.com/OWASP/www-project-top-10-for-large-language-model-applications/blob/main/2_0_vulns/LLM01_PromptInjection.md
  3. Daniel, Johan S.; Pal, Anand, „Impact of Non-Standard Unicode Characters on Security and Comprehension in Large Language Models“, 23. Mai 2024, https://arxiv.org/abs/2405.14490