prompt injections.de
Glossar

Großes Sprachmodell (LLM)

Ein großes Sprachmodell, kurz LLM, ist ein auf sehr großen Textdaten trainiertes neuronales Sprachmodell, das auf Basis eines gegebenen Kontexts wahrscheinliche Tokenfolgen erzeugt. In der Praxis können solche Modelle Fragen beantworten, Texte zusammenfassen, klassifizieren oder Werkzeugaufrufe vorbereiten. Ein LLM ist jedoch keine Zugriffsinstanz: Es entscheidet nicht verlässlich anhand einer technisch erzwingbaren Vertrauensgrenze, welcher Text Daten und welcher Text eine berechtigte Anweisung ist.1

Einordnung

Die Definition „sagt das nächste Token voraus“ beschreibt den generativen Kern, aber nicht die gesamte Anwendung. Ein produktives LLM-System umfasst zusätzlich Prompt-Aufbau, Datenabruf, Werkzeuge, Speicher und Zugriffskontrollen. Brown et al. beschreiben GPT-3 als autoregressives Sprachmodell, dessen Aufgaben und Demonstrationen per Textinteraktion vorgegeben werden; die Arbeit ist eine wichtige Grundlage für In-Context-Lernen, aber keine Sicherheitsarchitektur heutiger Agenten.2

Für Prompt Injection ist entscheidend, dass moderne Modelle zwar Rollenmarkierungen und durch Training gelernte Prioritäten berücksichtigen können, diese Priorisierung aber keine strikte Prozessisolation darstellt. Wallace und Kollegen identifizieren die unzureichende Trennung zwischen privilegierten Betreiberanweisungen und untrusted Text als wesentliche Schwachstelle und zeigen ein Training zur robusteren Befolgung einer Instruktionshierarchie.3 Verbesserte Modellrobustheit ist sinnvoll, ersetzt jedoch keine externe Autorisierungsprüfung.

Dokumentiertes Beispiel

Die Arbeit von Brown et al. dokumentiert ein konkretes Prinzip: Ein einziges autoregressives Modell erhält Aufgabe und Beispiele über Text im Kontext und löst Aufgaben ohne nachträgliche Gradientenaktualisierung oder Feinabstimmung.2 Dieses In-Context-Prinzip erklärt sowohl die flexible Nutzbarkeit als auch die Sicherheitsrelevanz des Eingabekontexts. Wenn eine Anwendung verschiedene Textquellen zusammenführt, können diese Quellen die Fortsetzung beeinflussen, selbst wenn sie aus Sicht des Betreibers nur auszuwertende Daten sein sollen.

Bedeutung für die Abwehr

Ein LLM sollte als leistungsfähige, aber fehlbare Interpretations- und Vorschlagskomponente eingeplant werden. Sicherheitskritische Entscheidungen gehören daher nicht in natürliche Sprachregeln allein. Die Anwendung muss Datenzugriffe, Mandantentrennung, zulässige Werkzeugparameter, Transaktionsgrenzen und Freigaben außerhalb des Modells prüfen. OWASP empfiehlt hierfür unter anderem geringste Privilegien, getrennte und erkennbare externe Inhalte sowie menschliche Kontrolle bei risikoreichen Aktionen.4

Das verändert auch die Bewertung von Schutzversprechen. Ein Modellfilter oder ein besserer System-Prompt kann die Fehlerrate reduzieren. Verlässlich wird die Architektur erst, wenn ein durch das Modell beeinflusster Vorschlag ohne zusätzliche, deterministische Prüfung keine sensible Information offenlegt und keine folgenschwere Aktion auslösen kann. Der relevante Maßstab ist damit nicht allein die Antwortqualität, sondern die begrenzte Schadenswirkung eines Modellfehlers.

Quellen

  1. OWASP Foundation, „LLM01:2026 Prompt Injection“, 3. August 2026, https://genai.owasp.org/resource/owasp-genai-llm-top-10-2026/.
  2. Tom B. Brown et al., „Language Models are Few-Shot Learners“, überarbeitete Fassung 22. Juli 2020, https://arxiv.org/abs/2005.14165.
  3. Eric Wallace et al., „The Instruction Hierarchy: Training LLMs to Prioritize Privileged Instructions“, 19. April 2024, https://arxiv.org/abs/2404.13208.
  4. OWASP Foundation, „LLM Prompt Injection Prevention Cheat Sheet“, abgerufen am 20. August 2026, https://cheatsheetseries.owasp.org/cheatsheets/LLM_Prompt_Injection_Prevention_Cheat_Sheet.html.