Klassifikator
Ein Klassifikator ist ein Modell oder Regelwerk, das eine Eingabe oder Ausgabe einer festgelegten Kategorie zuordnet, etwa „unbedenklich“, „Injektionsverdacht“ oder „Richtlinienverstoß“. In LLM-Anwendungen dient er häufig als schneller Baustein einer Guardrail-Schicht vor oder nach dem Hauptmodell. Seine Entscheidung ist eine Wahrscheinlichkeits- oder Labelprognose, kein Sicherheitsbeweis.1 OWASP führt Ein- und Ausgabefilter deshalb als schadensmindernde Maßnahme, nicht als narrensichere Prävention von Prompt Injection.2
Einordnung
Ein Prompt-Injection-Klassifikator sucht nicht nach der fachlichen Richtigkeit einer Antwort, sondern nach Merkmalen von Eingaben, die das Systemverhalten unerwünscht umsteuern könnten. Er unterscheidet sich damit sowohl vom Inhaltsfilter als auch von der Rechtekontrolle. Der Filter bewertet schädliche Inhaltskategorien, die Rechtekontrolle entscheidet unabhängig vom Text, ob eine Aktion zulässig ist. Ein Klassifikator kann verdächtigen Kontext markieren oder eine Sitzung zur Prüfung anhalten; er sollte jedoch nie allein darüber entscheiden, ob ein Modell vertrauliche Daten an ein externes Tool übertragen darf.
Die praktische Stärke liegt in Geschwindigkeit, lokaler Ausführbarkeit und klarer Einbindung in Messketten. Die Schwäche liegt in Verteilungseffekten: Trainingsdaten decken nur einen Ausschnitt von Sprachen, Formulierungen, Dokumenttypen und neuen Angriffsmustern ab. Ein hoher Erkennungswert auf einem Testsatz rechtfertigt deshalb keine generelle Sicherheitszusage. Besonders relevant sind falsch negative Ergebnisse bei unauffällig formulierten Anweisungen und falsch positive Ergebnisse bei legitimen, aber ungewöhnlichen Arbeitsaufträgen. Schwellwerte sind folglich betriebliche Entscheidungen, die für unterschiedliche Datenquellen, Sprachen und Konsequenzen getrennt kalibriert werden müssen.
Dokumentiertes Beispiel
Meta beschreibt Llama Prompt Guard 2 als zwei BERT-basierte Klassifikatoren mit 22 beziehungsweise 86 Millionen Parametern. Beide geben Labels für gutartigen oder bösartigen Text aus; der größere Detektor wurde mit englischen und nichtenglischen Angriffen trainiert, während der kleinere laut Dokumentation für ressourcenbeschränkte, englischsprachige Szenarien gedacht ist.1 Die Dokumentation nennt zudem ein Kontextlimit von 512 Tokens und empfiehlt, längere Eingaben in Segmente zu teilen. Das illustriert eine wichtige Betriebsgrenze: Ein Klassifikator sieht nur das, was ihm als Prüfobjekt vorgelegt wird, und seine Segmentierung kann selbst blinde Stellen erzeugen.
Bedeutung für die Abwehr
Sinnvoll ist der Einsatz als messbare, protokollierende Vorstufe: Kontext bewerten, Risiko kennzeichnen, gegebenenfalls eine sichere Alternative wählen und Entscheidung samt Modellversion speichern. Treffer sollten nicht nur blockiert, sondern mit Quelle, Sprache, Schwellenwert und späterer Fehlklassifikation ausgewertet werden. So entsteht aus der Guardrail ein lernfähiger Betrieb statt einer undurchsichtigen Sperre. Gegen neue Muster braucht der Klassifikator außerdem Regressionstests und anwendungsspezifische Daten; Meta empfiehlt ausdrücklich eine Feinabstimmung auf solche Daten.1 Für hochprivilegierte Aktionen bleibt eine unabhängige Autorisierung unverzichtbar, auch wenn der Content-Filter und der Klassifikator beide kein Risiko anzeigen.
Quellen
- Meta, „Llama Prompt Guard 2“, ohne Datumsangabe, https://developer.meta.com/ai/docs/model-cards-and-prompt-formats/prompt-guard/ ↩
- OWASP Gen AI Security Project, „LLM01:2026 Prompt Injection“, 3. August 2026sangabe, https://genai.owasp.org/resource/owasp-genai-llm-top-10-2026/ ↩