In-Context-Learning
In-Context-Learning bezeichnet die Fähigkeit eines Sprachmodells, eine Aufgabe aus Anweisungen und Beispielen im aktuellen Prompt zu erschließen, ohne dass ein zusätzliches Training oder eine Gewichtsänderung stattfindet. Das Modell passt sein Verhalten während der Antwortgenerierung an den bereitgestellten Kontext an; diese Anpassung ist damit temporär und an die jeweilige Eingabe gebunden. Der Begriff umfasst Zero-Shot-, One-Shot- und Few-Shot-Varianten, soweit der Kontext die Aufgabe und das erwartete Muster vermittelt.
Einordnung
Die grundlegende GPT-3-Arbeit von Brown und Kollegen demonstrierte Few-Shot-Leistung, bei der Aufgabenbeschreibung und Beispiele vollständig als Textinteraktion bereitgestellt wurden und keine Gradientenupdates vorgenommen wurden.1 In-Context-Learning ist folglich nicht mit Feintuning zu verwechseln: Feintuning verändert Modellparameter mit zusätzlichen Trainingsdaten und wirkt über die einzelne Sitzung hinaus; In-Context-Learning verändert nur den situativen Eingabekontext. Ebenfalls anders als Prompt Engineering bezeichnet es primär eine Modellfähigkeit, nicht die redaktionelle oder technische Praxis, Prompts gezielt zu gestalten.
Für Prompt Injection ist diese Fähigkeit ambivalent. Sie macht Beispiele nützlich, wenn eine Anwendung etwa ein gewünschtes Ausgabeformat, eine Klassifikation oder eine sichere Bearbeitungsregel demonstriert. Sie kann aber auch dazu führen, dass Beispiele aus fremden Dokumenten als handlungsleitendes Muster wirken. Die Forschung zu Many-Shot-Jailbreaking ordnet dieses ausdrücklich als Spezialfall von In-Context-Learning ein und berichtet, dass die Wirkung mit mehr Beispielen in ihrem Untersuchungsaufbau zunahm.2 Daraus folgt nicht, dass ein Modell Quellenstatus oder Nachrichtenrollen grundsätzlich ignoriert. Es verdeutlicht aber, dass Texte nicht allein deshalb ungefährlich sind, weil sie als „Beispiel“ oder „Dokumentinhalt“ erscheinen.
Dokumentiertes Beispiel
StruQ untersucht genau diese Trennungsfrage für LLM-Anwendungen. Der Ansatz formatiert Instruktionen und Nutzdaten in getrennten Bereichen und trainiert das Modell mit Fällen, in denen der Datenbereich selbst instruktionsähnlichen Text enthält; das Modell soll solchen Text im Datenbereich nicht befolgen.3 Das dokumentierte Beispiel ist keine vollständige Lösung des allgemeinen Prompt-Injection-Problems, zeigt aber die technische Relevanz der Unterscheidung zwischen Steuerinformation und zu verarbeitendem Inhalt. Ohne diese Abgrenzung kann ein abgerufener Text nicht nur Wissensquelle, sondern zugleich unerwünschte Demonstration sein.
Bedeutung für die Abwehr
Für die Abwehr ist nicht entscheidend, In-Context-Learning abzuschalten, sondern seinen Einfluss kontrolliert zu gestalten. Vertrauenswürdige Beispiele gehören in einen fest verwalteten Instruktionsbereich; externe Fundstellen, Uploads und Tool-Ausgaben müssen als untrusted Daten gekennzeichnet, begrenzt und aufgabenbezogen verarbeitet werden. OWASP empfiehlt dazu die Trennung und Kennzeichnung externer Inhalte, Ausgabevalidierung, Least Privilege und regelmäßige adversariale Tests.4 Betreiber sollten insbesondere prüfen, ob ein Modell durch lange Reihen fremder Beispiele sein Ausgabeformat, seine Prioritäten oder geplante Werkzeugaktionen ändert. Die Modellantwort bleibt probabilistisch; deshalb ergänzt eine sichere Architektur diese Prompt-Grenzen durch deterministische Kontrollen außerhalb des Modells.
Quellen
- Tom B. Brown et al., „Language Models are Few-Shot Learners“, 22. Juli 2020, https://arxiv.org/abs/2005.14165 ↩
- Anthropic, „Many-shot jailbreaking“, 2. April 2024, https://www.anthropic.com/research/many-shot-jailbreaking ↩
- Sizhe Chen et al., „StruQ: Defending Against Prompt Injection with Structured Queries“, 25. September 2024, https://arxiv.org/abs/2402.06363 ↩
- OWASP Gen AI Security Project, „LLM01:2026 Prompt Injection“, 3. August 2026, https://genai.owasp.org/resource/owasp-genai-llm-top-10-2026/ ↩