prompt injections.de
Glossar

Content-Filter

Ein Content-Filter prüft Eingaben oder Ausgaben auf vorab definierte Kategorien potenziell schädlicher Inhalte, etwa Hass, Gewalt, Selbstgefährdung oder sexuelle Inhalte. Er dient der Durchsetzung einer Inhaltsrichtlinie und der Risikominderung für Nutzende. Er erkennt jedoch nicht automatisch, ob ein Text eine Anwendung per Prompt Injection zu einer unzulässigen Handlung bewegen soll.1

Einordnung

Die Abgrenzung ist für LLM-Sicherheit zentral. Ein Inhaltsfilter fragt im Kern: „Fällt dieser Text in eine unerwünschte Kategorie?“ Eine Injektionsabwehr fragt zusätzlich: „Versucht dieser unzuverlässige Text, Rangfolge, Aufgabe, Werkzeugwahl oder Datenfluss des Systems zu verändern?“ Diese Fragen können zusammenfallen, müssen es aber nicht. Eine sachlich formulierte Aufforderung, interne Informationen in eine Zusammenfassung einzubauen oder einen vorhandenen Tool-Zugang anders zu nutzen, kann inhaltlich harmlos wirken und trotzdem einen Sicherheitskonflikt auslösen.

OpenAI dokumentiert für sein Moderationssystem Kategorien wie Belästigung, Hass, unerlaubte Handlungen, Selbstgefährdung, sexuelle Inhalte und Gewalt, teilweise getrennt nach Text- und Bildunterstützung.1 Diese Taxonomie ist nützlich für Inhaltsrisiken, bildet aber weder Instruktionshierarchien noch Berechtigungen oder Vertrauenszonen ab. Daraus folgt nicht, dass Moderation unwirksam wäre; vielmehr beantwortet sie eine andere Sicherheitsfrage. Eine Architektur, die sie als alleinigen Schutz gegen Prompt Injection einsetzt, verwechselt Inhalt mit Kontrollfluss.

Dokumentiertes Beispiel

Die Moderationsdokumentation zeigt die operative Form eines Content-Filters: Das System liefert Kategorien und Bewertungen für potenziell schädliche Text- oder Bildinhalte.1 Eine Anwendung kann damit etwa eine gewaltbezogene Ausgabe vor der Anzeige zurückhalten. Dasselbe Verfahren muss aber keine Auffälligkeit erkennen, wenn ein abgerufener Text eine eigentlich zulässige Fachanweisung in eine unerwünschte Prozessanweisung umdeutet. OWASP nennt als typische Folgen erfolgreicher Prompt Injection neben Inhaltsmanipulation auch sensible Informationspreisgabe, unbefugten Funktionszugriff und die Beeinflussung kritischer Entscheidungen.2 Diese Folgen liegen außerhalb einer reinen Inhaltsklassifikation.

Bedeutung für die Abwehr

Content-Filter gehören vor allem an Ausgabepunkte und an Eingänge mit klarer Inhaltsrichtlinie. Für Prompt-Injection-Abwehr müssen sie durch getrennte Kontrollen ergänzt werden: Kennzeichnung externer Inhalte, Erkennung verdächtiger Instruktionsmuster, strukturierte Tool-Aufrufe, minimale Rechte und menschliche Freigabe bei folgenreichen Operationen.2 Die Zuständigkeiten sollten im Sicherheitskonzept ausdrücklich getrennt sein. Dann lässt sich nach einem Vorfall feststellen, ob eine Ausgabe wegen ihres Inhalts, ein Kontext wegen eines Injektionsrisikos oder ein Tool-Aufruf wegen fehlender Autorisierung gestoppt wurde. Ein Klassifikator kann dabei Teil beider Prüfpfade sein, doch seine Trainingsaufgabe und sein Durchsetzungsort entscheiden über seine tatsächliche Aussagekraft.

Quellen

  1. OpenAI Developers, „Moderation“, ohne Datumsangabe, https://developers.openai.com/api/docs/guides/moderation
  2. OWASP Gen AI Security Project, „LLM01:2026 Prompt Injection“, 3. August 2026sangabe, https://genai.owasp.org/resource/owasp-genai-llm-top-10-2026/