Spotlighting
Spotlighting ist eine Familie von Prompt-Engineering-Techniken, die nicht vertrauenswürdigen Inhalt mit einem dauerhaften Herkunftssignal versieht. Das Modell soll dadurch unterscheiden können, welche Teile einer Anfrage aus Anweisungen stammen und welche lediglich zu verarbeitende Daten sind. Vorgeschlagen wurden insbesondere Abgrenzung durch Marker, Datenmarkierung und Kodierungstransformationen.1
Einordnung
Spotlighting richtet sich vor allem gegen indirekte Prompt Injection. Das Risiko entsteht, wenn eine Anwendung Fremdinhalte – etwa Webtexte, Dokumente oder Werkzeugantworten – neben einer Benutzeraufgabe in denselben Modellkontext legt und das Modell deren Herkunft nicht sicher unterscheiden kann.1 Die Methode ist damit weder ein Inhaltsfilter noch eine vollständige Instruktions-Hierarchie. Sie schafft ein Signal, das Modelltraining und Promptgestaltung bei der Trennung von Daten und Anweisungen nutzen können.
Unter dem Begriff fallen verschieden starke Varianten. Ein einfacher Begrenzer trennt Abschnitte sichtbar; Datamarking versieht Daten fortlaufend mit Markierungen; Encoding verändert ihre Darstellung systematisch. Welche Variante angemessen ist, hängt vom Modell, von der Datenform und von der kontrollierten Eingabekette ab. Der gemeinsame Zweck ist nicht, gefährlichen Text zu löschen, sondern seine Herkunft für die Verarbeitung kenntlich zu machen.1
Dokumentiertes Beispiel
Hines und Kollegen evaluierten Spotlighting gegen indirekte Injektionen auf GPT-Familienmodellen. In ihren Experimenten sank die Angriffserfolgsrate von über 50 Prozent auf unter 2 Prozent, während die geprüften NLP-Aufgaben laut den Autoren nur gering beeinträchtigt wurden.1 Dieser Wert ist eine präzise, aber eng begrenzte Studienaussage: Er gilt für deren Angriffe, Modellfamilien und Messaufbau und darf nicht als generelle Schutzquote weitergegeben werden.
Microsoft ordnete Spotlighting 2025 als präventive Technik zur Isolierung nicht vertrauenswürdiger Eingaben ein. Im selben Beitrag beschreibt das Microsoft Security Response Center eine mehrschichtige Abwehr, die gehärtete Systemprompts, Erkennung, Data Governance, Zustimmungsschritte und deterministische Maßnahmen gegen bekannte Exfiltrationswege verbindet.2 Das dokumentierte Produkt- und Betriebsbild bestätigt die richtige Einordnung: Herkunftsmarkierung ist ein Baustein, keine alleinige Sicherheitsgrenze.
Bedeutung für die Abwehr
Spotlighting ist besonders wertvoll, wenn externe Daten für die Aufgabe unverzichtbar sind und nicht einfach verworfen werden können. Die Daten sollten an jeder Übergabestelle als untrusted behandelt und ihre Markierung vor der Modellübergabe zuverlässig erzeugt werden. Zudem müssen Werkzeugrechte und Ausgabewege unabhängig vom Modell begrenzt bleiben. OWASP betont, dass es keine narrensichere Prävention gibt und dass Vertrauen, Zugriff und Wirkung eines Modells gemeinsam abgesichert werden müssen.3
Quellen
- Keegan Hines et al., „Defending Against Indirect Prompt Injection Attacks With Spotlighting“, 20. März 2024, https://arxiv.org/abs/2403.14720. ↩
- Andrew Paverd, Microsoft Security Response Center, „How Microsoft defends against indirect prompt injection attacks“, 29. Juli 2025, https://www.microsoft.com/en-us/msrc/blog/2025/07/how-microsoft-defends-against-indirect-prompt-injection-attacks. ↩
- OWASP Gen AI Security Project, „LLM01:2026 Prompt Injection“, 3. August 2026, https://genai.owasp.org/resource/owasp-genai-llm-top-10-2026/. ↩