Vigil
Vigil ist eine selbst betreibbare Python-Bibliothek und REST-API zur Prüfung von LLM-Prompts und -Antworten auf Prompt Injection, Jailbreaks und weitere Risiken. Anders als ein einzelner Klassifikator verbindet das Projekt mehrere Scanner, darunter Ähnlichkeitssuche, YARA-Heuristiken, ein Transformer-Modell und Canary Tokens.1 Für die Beschaffung ist der Versionsstand zentral: Das Repository führt v0.10.3-alpha vom 31. Dezember 2023 als jüngsten Release und bezeichnet die Anwendung ausdrücklich als experimentell beziehungsweise forschungsnah.1
Funktionsweise
Die Architektur ist modular. Ein eingereichter Text durchläuft die konfigurierten Scanner, deren Treffer zu einer Gesamteinschätzung beitragen können; die Dokumentation nennt Vector Database/Text Similarity, YARA-Heuristiken, Transformer, Prompt-Response-Similarity und Canary Tokens.1 Ergänzend führt die Dokumentation Sentimentanalyse, Relevanzprüfung mittels LLM, lokale oder OpenAI-basierte Embeddings und eine Streamlit-Oberfläche auf.2 Diese Kombination kann sprachliche, signaturbasierte und kontextbezogene Hinweise parallel verarbeiten, macht die Gesamtentscheidung aber abhängig von Schwellenwerten, Signaturqualität und der konkreten Konfiguration.
YARA-Regeln und Vektordatenbank sind dabei keine automatische Garantie gegen neue Varianten. Signaturen müssen fachlich gepflegt und in der eigenen Umgebung auf Fehlalarme geprüft werden; eine Ähnlichkeitssuche hängt von Embedding-Modell, Datenbestand und Vergleichsschwelle ab. Vigil stellt hierfür anpassbare YARA-Detektionen und eigene Daten bereit, nicht aber einen universellen Nachweis, jede neue Manipulationsform zu erkennen.2
Einsatz in der Praxis
Vigil kann direkt in eine Python-Anwendung importiert oder als REST-Dienst betrieben werden. Das Repository dokumentiert Endpunkte für Prompt- und Antwortanalyse, das Anlegen und Prüfen von Canary Tokens, das Hinzufügen von Texten und Einstellungen.1 Damit kann ein Team die Eingabeprüfung vor einen Modellaufruf setzen und Antworten nachgelagert auf Hinweise untersuchen. Für sensible Systeme sollte ein Treffer jedoch nur eine von mehreren Kontrollen auslösen: Berechtigungen, Datentrennung, Audit-Protokoll und ein sicherer Fallback bleiben eigenständige Aufgaben einer defensiven Architektur.
Selbsthosting reduziert die Übertragung der geprüften Texte an einen externen Klassifikationsdienst, erfordert aber Betriebskompetenz. Die Dokumentation erlaubt sowohl lokale Embeddings als auch eine OpenAI-Anbindung; diese Wahl verändert Datenflüsse, Abhängigkeiten und Kosten.2 Der bereitgestellte Funktionsumfang ist somit flexibel, aber nicht „wartungsfrei“.
Grenzen
Das größte dokumentierte Risiko ist der Reifegrad. Repository und Dokumentation bezeichnen Vigil als Alpha beziehungsweise experimentell; die Dokumentationsseite war am Recherchestichtag mit „Last updated 2 years ago“ ausgewiesen, während der jüngste Release Ende 2023 datiert.1 2 Das ist kein Beleg, dass das Projekt formell eingestellt wurde, wohl aber ein klarer Anlass, Sicherheitsupdates, Abhängigkeiten und Erkennungsregeln vor einer Einführung selbst zu auditieren.
Weder Repository noch Dokumentation veröffentlichen eine aktuelle, unabhängige Wirksamkeitsstudie mit belastbaren Ergebniswerten für die kombinierte Pipeline. Ein defensiver Einsatz sollte daher interne Regressionstests gegen harmlose, repräsentative und fortlaufend aktualisierte Testdaten vorsehen. Allgemeine Forschung zu Prompt-Klassifikatoren legt zusätzlich nahe, dass benchmarknahe Kennzahlen bei unbekannten Datenverteilungen zu optimistisch ausfallen können; sie untersucht Vigil nicht direkt.3
Lizenz und Bezug
Vigil steht unter der Apache License 2.0 und kann aus dem öffentlichen GitHub-Repository bezogen werden.1 Die Lizenz ermöglicht grundsätzlich auch kommerzielle Nutzung und Änderungen, während die operative Eignung durch Alpha-Status und lange Release-Pause begrenzt bleibt.1 Eine offizielle Nachricht über Übernahme oder Projekteinstellung war in den geprüften Primärquellen nicht vorhanden; belastbar dokumentiert sind lediglich der Alpha-Status und der alte Release-Stand.
Quellen
- Adam Swanda / deadbits, „vigil-llm“, 31. Dezember 2023, https://github.com/deadbits/vigil-llm ↩
- Adam Swanda / deadbits, „Vigil: Documentation“, o. D., https://vigil.deadbits.ai/ ↩
- Max Fomin, „When Benchmarks Lie: Evaluating Malicious Prompt Classifiers Under True Distribution Shift“, 19. Juli 2026, https://arxiv.org/abs/2602.14161 ↩