Base64- und Kodierungs-Umgehung
Die schädliche Anweisung wird kodiert übergeben (z. B. Base64) und erst vom Modell selbst dekodiert — Filter, die den Klartext prüfen, greifen ins Leere.
- Fachbegriff (EN)
- Base64-Encoded Prompt Injection
- Kategorie
- Obfuskation / Filter-Bypass
- OWASP-Klassifikation
- LLM01 — Prompt Injection
- Kernmechanismus
- Die Anweisung wird in Base64 (oder Hex, ROT13, anderen Kodierungen) verschleiert — der Filter sieht einen harmlosen String, das Modell dekodiert selbstständig und führt aus
- Voraussetzung
- Das Zielmodell muss Base64 selbstständig dekodieren können — das trifft auf alle modernen LLMs zu
- Wirkung
- Umgehung von Keyword-Blocklisten und einfachen Content-Filtern
- Typische Kombination
- Als Payload-Schicht in mehrstufigen Angriffen (Payload-Splitting, ArtPrompt / ASCII-Art)
- Wirksamste Gegenmaßnahme
- Semantische Analyse (nicht nur String-Matching) + Perplexitäts-Filter + Ausgabe-Prüfung
- Risiko-Einstufung
- Risiko mittel Mittel — gut dokumentiert, moderne Guardrails erkennen die Muster
Base64- und Kodierungs-Umgehung (englisch „Base64 / Encoding Bypass") gehört zur Kategorie Obfuskation und ist eine der dokumentierten Techniken der Prompt Injection gegen Sprachmodelle. Der Eintrag beschreibt das Wirkprinzip, damit Betreiber ihre Systeme prüfen und absichern können; eine Übersicht aller Verfahren steht im Techniken-Verzeichnis. Im Risikokatalog OWASP LLM Top 10 fällt die Technik unter LLM01: Prompt Injection.
Funktionsweise
- Der Filter sieht nur eine unverdächtige Zeichenkette.
- Das Modell dekodiert die Zeichenkette als Teil der Aufgabenbearbeitung.
- Die Arbeit „Jailbroken" führt dies auf ein Auseinanderfallen von Fähigkeiten und Sicherheitstraining zurück.
Risiko
Risiko mittel Die praktische Gefährdung produktiver Systeme wird für diese Technik als mittel eingestuft. Maßgeblich dafür sind die Rechte der betroffenen Anwendung: Je mehr eine LLM-Anwendung lesen, senden oder ausführen darf, desto größer ist der Schaden, den eine einzelne eingeschleuste Anweisung anrichten kann. OWASP führt den zugehörigen Risikobereich als LLM01 — Prompt Injection.
Schutz
Keine Einzelmaßnahme verhindert diese Technik vollständig. Wirksam ist gestaffelte Absicherung, bei der jede Schicht davon ausgeht, dass die vorherige versagt:
- Eingaben vor der Prüfung normalisieren und bekannte Kodierungen auflösen.
- Prüfung auch auf der Ausgabeseite, nicht nur auf der Eingabeseite.
- Auffällige Kodierungsdichte als Risikosignal werten.
Ausführlich behandelt der Bereich Schutz vor Prompt Injection die einzelnen Maßnahmen; passende Werkzeuge listet das Werkzeug-Verzeichnis.
Verwandte Techniken
-
Chiffren- und Leetspeak-Umgehung
Die Anfrage wird in einer einfachen Chiffre (ROT13, Caesar, Leetspeak, Morse) gestellt; das Modell entschlüsselt sie und antwortet, während Sicherheitsfilter die Bedeutung nicht erfassen.
Risiko mittel -
ASCII Smuggling (unsichtbare Unicode-Tags)
Anweisungen werden in Unicode-Tag-Zeichen kodiert, die in Oberflächen unsichtbar bleiben, vom Modell aber als Text gelesen werden — der Mensch sieht nichts, das Modell folgt.
Risiko hoch -
Payload-Splitting
Die schädliche Anweisung wird in harmlose Bruchstücke zerlegt, die einzeln jeden Filter passieren; das Modell setzt sie erst im Kontext wieder zusammen.
Risiko mittel
Quellen
- Base64- und Kodierungs-Umgehung — Primärquelle: https://arxiv.org/abs/2307.02483
Dieser Eintrag erklärt das Prinzip zu Verteidigungszwecken. Er enthält bewusst keine einsatzfertigen Angriffs-Payloads gegen konkrete Systeme (siehe redaktionelle Grundsätze).