{
  "meta": {
    "titel": "Werkzeuge gegen Prompt Injection",
    "title_en": "Tools against prompt injection",
    "version": "2.1.0",
    "stand": "2026-09-13",
    "sprache": "de",
    "anzahl": 32,
    "herausgeber": "Gökhan Köse, koeseo",
    "quelle": "https://promptinjections.de/",
    "lizenz": "CC-BY-4.0",
    "namensnennung": "promptinjections.de (Gökhan Köse), https://promptinjections.de"
  },
  "eintraege": [
    {
      "slug": "lakera-guard",
      "url": "https://promptinjections.de/tools/lakera-guard/",
      "name": "Lakera Guard",
      "anbieter": "Lakera",
      "typ": "guardrail-api",
      "lizenz": "kommerziell",
      "was": "Echtzeit-API zur Erkennung von Prompt Injection, Jailbreaks und Datenabfluss, die als Prüfschicht vor und hinter das Sprachmodell gehängt wird. Die Erkennung stützt sich auf laufend aktualisierte Modelle des Anbieters; Trainingsdaten und Schwellwerte sind nicht offengelegt, eine unabhängige Nachprüfung der Trefferquoten ist damit nicht möglich.",
      "einsatz": "Vorgelagerte Prüfung von Nutzereingaben und abgerufenen Inhalten in produktiven LLM-Anwendungen. Als gehosteter Dienst bedeutet der Einsatz, dass Prompts und abgerufene Inhalte an einen Dritten übertragen werden — bei personenbezogenen oder vertraulichen Daten ist das gesondert zu prüfen.",
      "quelle_url": "https://www.lakera.ai/lakera-guard",
      "belegt": true
    },
    {
      "slug": "gandalf",
      "url": "https://promptinjections.de/tools/gandalf/",
      "name": "Gandalf",
      "anbieter": "Lakera",
      "typ": "red-teaming",
      "lizenz": "kommerziell",
      "was": "Frei zugängliches Lernspiel, in dem Nutzer stufenweise versuchen, einem geschützten Sprachmodell ein Passwort zu entlocken — verbreitetes Schulungswerkzeug für Sicherheitsteams. Die Stufen bilden typische Schutzschichten nach, von fehlender Filterung bis zu kombinierter Ein- und Ausgabeprüfung, und machen deren jeweilige Grenzen unmittelbar erfahrbar.",
      "einsatz": "Sensibilisierung und Schulung; die gesammelten Versuche fließen in Lakeras Angriffsdatenbestand ein. Als Bewertungsmaßstab für die eigene Anwendung taugt es nicht: Gemessen wird eine didaktisch aufgebaute Übung, kein produktives System.",
      "quelle_url": "https://gandalf.lakera.ai/",
      "belegt": true
    },
    {
      "slug": "rebuff",
      "url": "https://promptinjections.de/tools/rebuff/",
      "name": "Rebuff",
      "anbieter": "Protect AI",
      "typ": "guardrail-framework",
      "lizenz": "open-source",
      "was": "Prompt-Injection-Detektor mit vier Schichten: Heuristiken, LLM-basierte Prüfung, Vektor-Datenbank bekannter Angriffe und Canary-Tokens zur Leck-Erkennung. Die Kombination deckt unterschiedliche Angriffsklassen ab, erhöht aber Latenz und Betriebsaufwand, weil Vektorbestand und Heuristiken gepflegt werden müssen.",
      "einsatz": "Selbst gehostete Absicherung eigener LLM-Anwendungen, insbesondere in Python-Stacks. Vor dem Produktiveinsatz lohnt ein Blick auf den Pflegestand des Projekts — bei Erkennungswerkzeugen veraltet ein ungepflegter Signatur- und Musterbestand schnell.",
      "quelle_url": "https://github.com/protectai/rebuff",
      "belegt": true
    },
    {
      "slug": "llm-guard",
      "url": "https://promptinjections.de/tools/llm-guard/",
      "name": "LLM Guard",
      "anbieter": "Protect AI",
      "typ": "guardrail-framework",
      "lizenz": "open-source",
      "was": "Sicherheits-Toolkit mit Scannern für Eingaben und Ausgaben — Prompt Injection, Anonymisierung, Geheimnisse, Toxizität, Relevanz und mehr. Die Scanner sind einzeln zuschaltbar; jeder zusätzliche kostet Rechenzeit, weshalb sich die Auswahl an den tatsächlichen Risiken der Anwendung orientieren sollte.",
      "einsatz": "Laufzeit-Guardrail in eigener Infrastruktur, ohne Datenabfluss an einen Anbieter. Die Injektionserkennung stützt sich auf ein Klassifikationsmodell und teilt dessen Grenzen: Neue Formulierungen und andere Sprachen als Englisch werden schlechter erkannt.",
      "quelle_url": "https://github.com/protectai/llm-guard",
      "belegt": true
    },
    {
      "slug": "deberta-prompt-injection",
      "url": "https://promptinjections.de/tools/deberta-prompt-injection/",
      "name": "DeBERTa Prompt-Injection-Klassifikator",
      "anbieter": "Protect AI",
      "typ": "schutzmodell",
      "lizenz": "open-source",
      "was": "Feingetuntes DeBERTa-Modell, das Eingaben binär als Prompt Injection oder als unbedenklich klassifiziert. Das Modell ist klein genug für den Betrieb auf gewöhnlicher CPU-Hardware und antwortet im Millisekundenbereich, was den Einsatz als Vorfilter vor jedem Modellaufruf praktikabel macht.",
      "einsatz": "Schnelle, lokal betreibbare Vorfilterung ohne API-Aufruf an Dritte. Es entscheidet binär und ohne Begründung; Fehlklassifikationen sind dadurch schwer nachzuvollziehen, und die Trefferquote fällt bei Eingaben ab, die den Trainingsdaten nicht ähneln.",
      "quelle_url": "https://huggingface.co/protectai/deberta-v3-base-prompt-injection-v2",
      "belegt": true
    },
    {
      "slug": "guardrails-ai",
      "url": "https://promptinjections.de/tools/guardrails-ai/",
      "name": "Guardrails AI",
      "anbieter": "Guardrails AI",
      "typ": "guardrail-framework",
      "lizenz": "open-source",
      "was": "Framework mit einem Hub austauschbarer Validatoren, die Ein- und Ausgaben gegen definierte Regeln prüfen und bei Verstoß korrigieren oder ablehnen. Die Validatoren reichen von Formatprüfungen bis zu inhaltlichen Regeln; ihre Qualität schwankt, weil ein Teil aus der Community stammt und unterschiedlich gepflegt wird.",
      "einsatz": "Strukturvalidierung und Richtliniendurchsetzung rund um Modellaufrufe. Am stärksten ist das Framework bei strukturierten Ausgaben — als alleiniger Schutz gegen Prompt Injection ist es nicht ausgelegt.",
      "quelle_url": "https://github.com/guardrails-ai/guardrails",
      "belegt": true
    },
    {
      "slug": "nemo-guardrails",
      "url": "https://promptinjections.de/tools/nemo-guardrails/",
      "name": "NeMo Guardrails",
      "anbieter": "NVIDIA",
      "typ": "guardrail-framework",
      "lizenz": "open-source",
      "was": "Framework für programmierbare Leitplanken: Mit der Sprache Colang werden erlaubte Gesprächsverläufe, Themen und Aktionen deklarativ festgelegt. Der deklarative Ansatz macht die Gesprächsführung nachvollziehbar und prüfbar, verlangt aber die Einarbeitung in eine eigene Sprache und die laufende Pflege der Regelwerke.",
      "einsatz": "Dialogsysteme, bei denen die Steuerung des Gesprächsverlaufs wichtiger ist als reine Eingabefilterung. In offenen Aufgabenstellungen ohne vorhersehbare Dialogpfade verliert der Ansatz an Wirkung, weil sich erlaubte Verläufe kaum vollständig beschreiben lassen.",
      "quelle_url": "https://github.com/NVIDIA/NeMo-Guardrails",
      "belegt": true
    },
    {
      "slug": "garak",
      "url": "https://promptinjections.de/tools/garak/",
      "name": "garak",
      "anbieter": "NVIDIA",
      "typ": "scanner",
      "lizenz": "open-source",
      "was": "Schwachstellen-Scanner für Sprachmodelle mit einer großen Sammlung von Prüfmodulen für Prompt Injection, Jailbreaks, Datenlecks, Toxizität und Halluzination. Die Prüfmodule sind einzeln wählbar und liefern einen Bericht je Angriffsklasse, was den Vergleich über Modellversionen hinweg erleichtert.",
      "einsatz": "Automatisierte Modellprüfung in der CI-Pipeline vor jedem Modell- oder Prompt-Wechsel. Ein vollständiger Lauf erzeugt viele Modellaufrufe und damit Kosten und Laufzeit; für die CI empfiehlt sich eine feste Teilmenge. Wie jeder Scanner misst er nur, was seine Module abdecken.",
      "quelle_url": "https://github.com/NVIDIA/garak",
      "belegt": true
    },
    {
      "slug": "pyrit",
      "url": "https://promptinjections.de/tools/pyrit/",
      "name": "PyRIT",
      "anbieter": "Microsoft",
      "typ": "red-teaming",
      "lizenz": "open-source",
      "was": "Python Risk Identification Toolkit — Automatisierungs-Framework für KI-Red-Teaming mit Orchestratoren für mehrstufige Angriffe wie Crescendo. Es liefert die Automatisierung, nicht das Urteil: Angriffsziele, Bewertungskriterien und Interpretation der Ergebnisse bleiben beim Team.",
      "einsatz": "Strukturiertes, wiederholbares Red-Teaming eigener generativer Systeme. Die Einarbeitung ist spürbar — für einen einmaligen Sicherheitscheck ist der Aufwand hoch, für wiederkehrendes Red Teaming zahlt er sich aus.",
      "quelle_url": "https://github.com/Azure/PyRIT",
      "belegt": true
    },
    {
      "slug": "promptfoo",
      "url": "https://promptinjections.de/tools/promptfoo/",
      "name": "promptfoo",
      "anbieter": "promptfoo",
      "typ": "red-teaming",
      "lizenz": "open-source",
      "was": "Test- und Red-Teaming-Werkzeug für Prompts und Modelle mit Plugin-System für Angriffsklassen und CI-Integration. Testfälle werden in YAML beschrieben, wodurch sich Qualitäts- und Sicherheitsprüfungen im selben Lauf abbilden und versionieren lassen.",
      "einsatz": "Regressionstests für Prompts und automatisierte Sicherheitsprüfungen bei jedem Deployment. Der Nutzen steht und fällt mit den selbst definierten Prüfkriterien: Ein grüner Lauf belegt nur, dass die hinterlegten Fälle bestanden wurden.",
      "quelle_url": "https://github.com/promptfoo/promptfoo",
      "belegt": true
    },
    {
      "slug": "vigil",
      "url": "https://promptinjections.de/tools/vigil/",
      "name": "Vigil",
      "anbieter": "Vigil (Adam Swanda)",
      "typ": "scanner",
      "lizenz": "open-source",
      "was": "Python-Bibliothek und REST-API zur Erkennung riskanter LLM-Eingaben — kombiniert Vektorsuche, YARA-Regeln, Transformer-Modell und Canary-Tokens. Die Signaturen lassen sich an eigene Anwendungsfälle anpassen, was das Werkzeug flexibler macht als reine Modellklassifikatoren.",
      "einsatz": "Selbst betriebene Eingabeprüfung mit anpassbaren Signaturen. Signaturbasierte Erkennung altert ohne laufende Aktualisierung schnell; der Pflegestand des Projekts gehört deshalb in die Auswahlentscheidung.",
      "quelle_url": "https://github.com/deadbits/vigil-llm",
      "belegt": true
    },
    {
      "slug": "llamafirewall",
      "url": "https://promptinjections.de/tools/llamafirewall/",
      "name": "LlamaFirewall",
      "anbieter": "Meta",
      "typ": "guardrail-framework",
      "lizenz": "open-source",
      "was": "Guardrail-System für Agenten, das Eingaben, Zwischenschritte der Modell-Argumentation und erzeugten Code prüft, bevor eine riskante Aktion ausgeführt wird. Die Prüfung der Zwischenschritte zielt auf genau die Lücke, die reine Ein- und Ausgabefilter offenlassen: die Entscheidung des Agenten zwischen Eingabe und Aktion.",
      "einsatz": "Absicherung agentischer Systeme mit Werkzeugzugriff und Codeausführung. Der Ansatz setzt Zugriff auf diese Zwischenschritte voraus und lässt sich deshalb nicht ohne Weiteres vor eine fremde, geschlossene Agenten-Plattform schalten.",
      "quelle_url": "https://github.com/meta-llama/PurpleLlama/tree/main/LlamaFirewall",
      "belegt": true
    },
    {
      "slug": "prompt-guard",
      "url": "https://promptinjections.de/tools/prompt-guard/",
      "name": "Llama Prompt Guard",
      "anbieter": "Meta",
      "typ": "schutzmodell",
      "lizenz": "open-source",
      "was": "Kompaktes Klassifikationsmodell, das Nutzereingaben und abgerufene Inhalte auf Jailbreak- und Injektionsversuche prüft. Meta gibt an, dass das Modell auch bei nicht englischen Eingaben arbeitet; die Erkennungsqualität schwankt dennoch je nach Sprache und Formulierung.",
      "einsatz": "Vorgelagerter Filter mit geringer Latenz, auch für nicht englische Eingaben. Es klassifiziert einzelne Eingaben und erkennt mehrstufige Angriffe wie Crescendo oder Echo Chamber nicht, deren Wirkung erst aus dem Gesprächsverlauf entsteht.",
      "quelle_url": "https://github.com/meta-llama/PurpleLlama/tree/main/Llama-Prompt-Guard-2",
      "belegt": true
    },
    {
      "slug": "llama-guard",
      "url": "https://promptinjections.de/tools/llama-guard/",
      "name": "Llama Guard",
      "anbieter": "Meta",
      "typ": "schutzmodell",
      "lizenz": "open-source",
      "was": "Auf Inhaltssicherheit spezialisiertes Modell, das Eingaben und Antworten anhand einer anpassbaren Risikotaxonomie klassifiziert. Die Risikotaxonomie ist anpassbar, wodurch sich eigene Richtlinien abbilden lassen, ohne das Modell neu zu trainieren.",
      "einsatz": "Ausgabeseitige Absicherung, kombinierbar mit Prompt Guard auf der Eingabeseite. Es adressiert Inhaltsrisiken; gegen die Übernahme der Anwendungslogik durch Prompt Injection ist es nicht ausgelegt und muss mit Injektionserkennung kombiniert werden.",
      "quelle_url": "https://github.com/meta-llama/PurpleLlama/tree/main/Llama-Guard4",
      "belegt": true
    },
    {
      "slug": "azure-prompt-shields",
      "url": "https://promptinjections.de/tools/azure-prompt-shields/",
      "name": "Azure AI Prompt Shields",
      "anbieter": "Microsoft",
      "typ": "guardrail-api",
      "lizenz": "kommerziell",
      "was": "Dienst innerhalb von Azure AI Content Safety, der direkte Jailbreak-Angriffe und indirekte Injektionen in eingebetteten Dokumenten erkennt. Der Dienst unterscheidet zwischen Angriffen auf den Nutzerprompt und Injektionen in eingebetteten Dokumenten und meldet beide getrennt.",
      "einsatz": "Guardrail für Anwendungen auf Azure OpenAI und Azure AI Foundry. Er ist eng an das Azure-Ökosystem gebunden; Microsoft weist selbst darauf hin, dass die Erkennung nicht vollständig ist und weitere Schutzschichten nötig bleiben.",
      "quelle_url": "https://learn.microsoft.com/en-us/azure/ai-services/content-safety/concepts/jailbreak-detection",
      "belegt": true
    },
    {
      "slug": "bedrock-guardrails",
      "url": "https://promptinjections.de/tools/bedrock-guardrails/",
      "name": "Amazon Bedrock Guardrails",
      "anbieter": "Amazon Web Services",
      "typ": "guardrail-api",
      "lizenz": "kommerziell",
      "was": "Konfigurierbare Leitplanken auf Plattformebene mit Filtern für schädliche Inhalte, gesperrte Themen, sensible Daten und Prompt-Angriffe. Die Leitplanken werden auf Plattformebene definiert und wirken dadurch modellübergreifend und unabhängig vom Anwendungscode.",
      "einsatz": "Modellunabhängige Absicherung von Anwendungen auf Amazon Bedrock. Die Konfiguration ist an AWS gebunden und nicht auf andere Plattformen übertragbar; die zusätzlichen Prüfschritte verursachen Kosten und Latenz je Anfrage.",
      "quelle_url": "https://aws.amazon.com/bedrock/guardrails/",
      "belegt": true
    },
    {
      "slug": "model-armor",
      "url": "https://promptinjections.de/tools/model-armor/",
      "name": "Model Armor",
      "anbieter": "Google Cloud",
      "typ": "guardrail-api",
      "lizenz": "kommerziell",
      "was": "Dienst zur Prüfung von Prompts und Antworten auf Prompt Injection, Jailbreak-Versuche, sensible Daten und schädliche URLs. Die Prüfung greift auf der Eingabe- wie auf der Ausgabeseite und lässt sich zentral über mehrere Anwendungen hinweg verwalten.",
      "einsatz": "Zentraler Guardrail für generative Anwendungen in der Google Cloud. Wie bei den vergleichbaren Diensten von AWS und Microsoft gilt: Die Bindung an die Plattform ist eng, und die Erkennungsleistung ist von außen nicht unabhängig überprüfbar.",
      "quelle_url": "https://cloud.google.com/security-command-center/docs/model-armor-overview",
      "belegt": true
    },
    {
      "slug": "openai-moderation",
      "url": "https://promptinjections.de/tools/openai-moderation/",
      "name": "OpenAI Moderation API",
      "anbieter": "OpenAI",
      "typ": "guardrail-api",
      "lizenz": "kommerziell",
      "was": "Klassifikations-API, die Texte und Bilder gegen eine Kategorienliste schädlicher Inhalte prüft. Die API ist für Kunden der Plattform kostenfrei nutzbar und deckt Text- wie Bildeingaben ab.",
      "einsatz": "Ausgabeseitige Inhaltsprüfung — deckt Inhaltsrisiken ab, ist aber kein spezialisierter Injektionsschutz. Sie prüft Inhaltskategorien und erkennt keine Anweisungsübernahme — eine höflich formulierte Injektion passiert sie unauffällig.",
      "quelle_url": "https://platform.openai.com/docs/guides/moderation",
      "belegt": true
    },
    {
      "slug": "camel",
      "url": "https://promptinjections.de/tools/camel/",
      "name": "CaMeL",
      "anbieter": "Google DeepMind (Forschung)",
      "typ": "forschungs-referenz",
      "lizenz": "forschung",
      "was": "Referenzimplementierung einer architektonischen Abwehr: Kontroll- und Datenfluss werden aus der vertrauenswürdigen Anfrage extrahiert, nicht vertrauenswürdige Daten können den Programmfluss nicht mehr beeinflussen. Die Sicherheitsaussage folgt aus der Architektur und nicht aus der Modellqualität und gilt damit unabhängig vom eingesetzten Sprachmodell.",
      "einsatz": "Vorbild für Agenten-Architekturen, die Sicherheit nicht dem Modell überlassen, sondern einer deterministischen Policy-Schicht. Es handelt sich um eine Forschungsreferenz, nicht um ein einsatzfertiges Produkt: Aufgaben, deren Ablauf sich erst aus den Daten ergibt, lassen sich nur eingeschränkt abbilden.",
      "quelle_url": "https://github.com/google-research/camel-prompt-injection",
      "belegt": true
    },
    {
      "slug": "secalign",
      "url": "https://promptinjections.de/tools/secalign/",
      "name": "SecAlign",
      "anbieter": "Meta / UC Berkeley (Forschung)",
      "typ": "forschungs-referenz",
      "lizenz": "forschung",
      "was": "Trainingsverfahren, das Modelle mittels Preference-Optimierung gegen Prompt Injection härtet — es lernt, die injizierte Antwort systematisch niedriger zu bewerten. Die Autoren berichten gegenüber dem Vorgängerverfahren StruQ eine nochmals deutlich gesenkte Erfolgsquote optimierungsfreier Angriffe.",
      "einsatz": "Modellseitige Härtung als Ergänzung zu externen Guardrails. Voraussetzung sind Zugriff auf Modellgewichte und Trainingsinfrastruktur; für Anwendungen auf fremden APIs kommt der Ansatz nicht in Frage.",
      "quelle_url": "https://github.com/facebookresearch/SecAlign",
      "belegt": true
    },
    {
      "slug": "struq",
      "url": "https://promptinjections.de/tools/struq/",
      "name": "StruQ",
      "anbieter": "UC Berkeley (Forschung)",
      "typ": "forschungs-referenz",
      "lizenz": "forschung",
      "was": "Strukturiertes Instruction-Tuning: Reservierte Sondertoken trennen Anweisungs- und Datenbereich, das Modell lernt, Anweisungen im Datenbereich zu ignorieren. Damit die Trennung hält, müssen die reservierten Sondertoken aus allen Nutzer- und Dokumentdaten zuverlässig entfernt werden.",
      "einsatz": "Referenz für Anwendungen, die eigene Modelle auf saubere Anweisungs-/Daten-Trennung feintunen. Wie SecAlign senkt das Verfahren die Erfolgsquote, ohne sie auf null zu bringen — Rechtebegrenzung außerhalb des Modells bleibt notwendig.",
      "quelle_url": "https://github.com/Sizhe-Chen/StruQ",
      "belegt": true
    },
    {
      "slug": "jatmo",
      "url": "https://promptinjections.de/tools/jatmo/",
      "name": "Jatmo",
      "anbieter": "UC Berkeley (Forschung)",
      "typ": "forschungs-referenz",
      "lizenz": "forschung",
      "was": "Ansatz, aufgabenspezifisch feingetunte Modelle ohne Instruktions-Fähigkeit einzusetzen — was keine Anweisungen befolgt, lässt sich auch nicht per Anweisung entführen. Der Schutz entsteht durch eine weggelassene Fähigkeit: Ein Modell ohne Instruktions-Tuning besitzt keinen Mechanismus, über den eine eingebettete Anweisung wirken könnte.",
      "einsatz": "Enge, klar umrissene Aufgaben wie Klassifikation, Extraktion oder Übersetzung. Der Preis ist Flexibilität — je Aufgabe braucht es ein eigenes Modell, und jede Änderung der Aufgabe erfordert ein neues Training.",
      "quelle_url": "https://arxiv.org/abs/2312.17673",
      "belegt": true
    },
    {
      "slug": "agentdojo",
      "url": "https://promptinjections.de/tools/agentdojo/",
      "name": "AgentDojo",
      "anbieter": "ETH Zürich (SPY Lab)",
      "typ": "benchmark",
      "lizenz": "open-source",
      "was": "Dynamische Testumgebung, die Agenten mit realistischen Aufgaben und eingebetteten Injektionen konfrontiert und Nützlichkeit gegen Sicherheit misst. Gemessen werden Nützlichkeit und Sicherheit gemeinsam, weil eine Abwehr wertlos ist, die den Agenten für seine eigentliche Aufgabe unbrauchbar macht.",
      "einsatz": "Vergleichbare Bewertung von Agenten-Architekturen und Abwehrmaßnahmen. Die Umgebung bildet ausgewählte Aufgaben nach; gute Werte belegen Widerstandsfähigkeit gegen die enthaltenen Angriffe, nicht gegen unbekannte.",
      "quelle_url": "https://github.com/ethz-spylab/agentdojo",
      "belegt": true
    },
    {
      "slug": "injecagent",
      "url": "https://promptinjections.de/tools/injecagent/",
      "name": "InjecAgent",
      "anbieter": "University of Illinois (Kang Lab)",
      "typ": "benchmark",
      "lizenz": "open-source",
      "was": "Benchmark für indirekte Prompt Injection in werkzeugnutzenden Agenten, unterteilt in Angriffe auf Nutzerdaten und auf Nutzeraktionen. Die Unterteilung macht sichtbar, ob ein Angriff lediglich Daten abgreift oder den Agenten zu eigenen, folgenreichen Handlungen bringt.",
      "einsatz": "Messung der Anfälligkeit eigener Agenten gegenüber Tool-basierten Injektionen. Der Benchmark arbeitet mit simulierten Werkzeugen; die Ergebnisse übertragen sich nicht ungeprüft auf eine produktive Werkzeuglandschaft.",
      "quelle_url": "https://github.com/uiuc-kang-lab/InjecAgent",
      "belegt": true
    },
    {
      "slug": "open-prompt-injection",
      "url": "https://promptinjections.de/tools/open-prompt-injection/",
      "name": "Open-Prompt-Injection",
      "anbieter": "Duke University (Forschung)",
      "typ": "benchmark",
      "lizenz": "open-source",
      "was": "Offenes Framework zur systematischen Bewertung von Prompt-Injection-Angriffen und Abwehrmaßnahmen über mehrere Aufgaben und Modelle hinweg. Der modulare Aufbau erlaubt es, Angriffe und Abwehrmaßnahmen unabhängig voneinander auszutauschen und so einzelne Faktoren zu isolieren.",
      "einsatz": "Reproduzierbare Vergleichsmessungen in Forschung und interner Evaluation. Es richtet sich an Forschung und interne Evaluation; für den laufenden Betrieb ist es kein Guardrail, sondern ein Messwerkzeug.",
      "quelle_url": "https://github.com/liu00222/Open-Prompt-Injection",
      "belegt": true
    },
    {
      "slug": "hackaprompt-datensatz",
      "url": "https://promptinjections.de/tools/hackaprompt-datensatz/",
      "name": "HackAPrompt-Datensatz",
      "anbieter": "Learn Prompting",
      "typ": "benchmark",
      "lizenz": "open-source",
      "was": "Offener Datensatz mit über 600.000 realen Angriffs-Prompts aus einem globalen Prompt-Hacking-Wettbewerb, taxonomisch aufbereitet. Die Prompts stammen aus einem Wettbewerb und sind entsprechend auf dessen Aufgabenstellungen zugeschnitten.",
      "einsatz": "Trainings- und Testmaterial für eigene Erkennungsmodelle. Wer ausschließlich darauf trainiert, erhält einen Detektor, der die enthaltenen Muster gut erkennt und neue Formulierungen übersieht — der Datensatz taugt als Ergänzung, nicht als alleinige Grundlage.",
      "quelle_url": "https://huggingface.co/datasets/hackaprompt/hackaprompt-dataset",
      "belegt": true
    },
    {
      "slug": "mcp-scan",
      "url": "https://promptinjections.de/tools/mcp-scan/",
      "name": "mcp-scan",
      "anbieter": "Invariant Labs",
      "typ": "scanner",
      "lizenz": "open-source",
      "was": "Prüfwerkzeug für MCP-Server, das Tool-Beschreibungen auf versteckte Anweisungen, Tool-Poisoning und nachträgliche Änderungen untersucht. Es vergleicht Tool-Beschreibungen zusätzlich gegen einen festgehaltenen Stand und meldet nachträgliche Änderungen, mit denen ein zunächst harmloser Server später Anweisungen nachschiebt.",
      "einsatz": "Absicherung der Werkzeug-Lieferkette in agentischen Systemen. Geprüft werden die Beschreibungen, nicht das Laufzeitverhalten — ein Server kann trotz sauberer Definition abweichende Antworten liefern.",
      "quelle_url": "https://github.com/invariantlabs-ai/mcp-scan",
      "belegt": true
    },
    {
      "slug": "giskard",
      "url": "https://promptinjections.de/tools/giskard/",
      "name": "Giskard",
      "anbieter": "Giskard",
      "typ": "scanner",
      "lizenz": "open-source",
      "was": "Testframework für KI-Systeme, das automatisiert nach Schwachstellen sucht — darunter Prompt Injection, Halluzination und Vorurteile — und Testberichte erzeugt. Die erzeugten Berichte sind auf Nachvollziehbarkeit ausgelegt und eignen sich als Grundlage für Freigabeentscheidungen.",
      "einsatz": "Qualitäts- und Sicherheitsprüfung von LLM-Anwendungen vor dem Produktivgang. Der Fokus liegt auf breiter Qualitätsprüfung; für tiefes Red Teaming speziell gegen Prompt Injection arbeiten spezialisierte Werkzeuge gründlicher.",
      "quelle_url": "https://github.com/Giskard-AI/giskard",
      "belegt": true
    },
    {
      "slug": "langkit",
      "url": "https://promptinjections.de/tools/langkit/",
      "name": "LangKit",
      "anbieter": "WhyLabs",
      "typ": "scanner",
      "lizenz": "open-source",
      "was": "Bibliothek zur Extraktion von Telemetriedaten aus Prompts und Antworten, unter anderem Ähnlichkeit zu bekannten Injektionsmustern. Es erkennt und blockiert nicht, sondern liefert Kennzahlen — die Bewertung bleibt nachgelagerten Systemen überlassen.",
      "einsatz": "Beobachtbarkeit und Drift-Erkennung im laufenden Betrieb. Sinnvoll ist es als Ergänzung zu einem Guardrail: Es zeigt Veränderungen im Eingabeverhalten, aus denen sich Angriffswellen frühzeitig ablesen lassen.",
      "quelle_url": "https://github.com/whylabs/langkit",
      "belegt": true
    },
    {
      "slug": "hiddenlayer-aisec",
      "url": "https://promptinjections.de/tools/hiddenlayer-aisec/",
      "name": "HiddenLayer AISec Platform",
      "anbieter": "HiddenLayer",
      "typ": "plattform",
      "lizenz": "kommerziell",
      "was": "Sicherheitsplattform für KI-Systeme mit Modell-Scanning, Laufzeitüberwachung und einer eigenen Forschungseinheit für Angriffstechniken. Die hauseigene Forschungseinheit veröffentlicht regelmäßig eigene Befunde, darunter die modellübergreifende Policy-Puppetry-Vorlage.",
      "einsatz": "Unternehmensweiter Schutz von Modell-Lieferkette und Betrieb. Als kommerzielle Plattform ist der Funktionsumfang nicht öffentlich nachprüfbar; veröffentlichte Wirksamkeitsangaben stammen vom Anbieter selbst.",
      "quelle_url": "https://hiddenlayer.com/aisec-platform/",
      "belegt": true
    },
    {
      "slug": "cisco-ai-defense",
      "url": "https://promptinjections.de/tools/cisco-ai-defense/",
      "name": "Cisco AI Defense",
      "anbieter": "Cisco",
      "typ": "plattform",
      "lizenz": "kommerziell",
      "was": "Plattform zur Absicherung von KI-Anwendungen mit automatisiertem Modell-Red-Teaming und Laufzeit-Leitplanken. Automatisiertes Red Teaming und Laufzeit-Leitplanken sind in einer Oberfläche zusammengeführt, was zentrale Governance über viele Anwendungen erleichtert.",
      "einsatz": "Zentrale Governance über mehrere Modelle und Anwendungen im Unternehmen. Der Zuschnitt zielt auf größere Organisationen; für einzelne Anwendungen ist der Aufwand hoch, und die Erkennungsleistung ist von außen nicht überprüfbar.",
      "quelle_url": "https://blogs.cisco.com/security/cisco-ai-defense",
      "belegt": true
    },
    {
      "slug": "neuraltrust",
      "url": "https://promptinjections.de/tools/neuraltrust/",
      "name": "NeuralTrust",
      "anbieter": "NeuralTrust",
      "typ": "plattform",
      "lizenz": "kommerziell",
      "was": "Gateway und Guardrail-Plattform für LLM-Anwendungen; die hauseigene Forschung veröffentlichte unter anderem die Echo-Chamber-Technik. Die veröffentlichten Forschungsergebnisse — darunter die Echo-Chamber-Technik — sind unabhängig vom Produkt nachvollziehbar dokumentiert.",
      "einsatz": "Vorgeschaltetes Sicherheits-Gateway für Unternehmens-Chatbots. Als vorgeschaltetes Gateway liegt es im kritischen Pfad jeder Anfrage; Ausfallverhalten und zusätzliche Latenz gehören deshalb in die Bewertung.",
      "quelle_url": "https://neuraltrust.ai/",
      "belegt": true
    }
  ]
}
