HackAPrompt-Datensatz
Der HackAPrompt-Datensatz ist eine offene Sammlung menschlich eingereichter Prompt-Hacking-Versuche aus einem globalen Wettbewerb. Herausgegeben wurde sie im Umfeld von Learn Prompting; sie dient der Forschung über Prompt Injection und verwandte Manipulationsversuche, nicht als produktiver Erkennungsdienst.1 Sein Wert liegt in der Breite realer Wettbewerbseingaben, seine Aussagekraft bleibt aber an die damaligen Aufgaben, Modelle und Regeln des Wettbewerbs gebunden.
Funktionsweise
Die Datensatzkarte beschreibt zwei Quellen: einen Playground für Experimente und eine Plattform für offizielle Wettbewerbseinreichungen.1 Für die Wettbewerbslevels wurden GPT-3, FlanT5-XXL und GPT-3.5-turbo ausgewertet.1 Die wissenschaftliche EMNLP-Publikation dokumentiert mehr als 600.000 adversariale Prompts gegen diese drei damaligen LLMs sowie eine Ontologie der beobachteten Prompt-Typen.2 Damit ist HackAPrompt in erster Linie Rohmaterial für Taxonomie, Training, Auswertung und Fehleranalyse.
Die veröffentlichte Karte beschreibt Metadaten wie Eingabelänge, Erfolg nach der jeweiligen Wettbewerbsauswertung, Fehlerstatus, Herkunftskategorie und für Playground-Daten einen Zeitstempel.1 Die Daten wurden automatisiert bewertet; Einsendungen, die Fehler auslösten, wurden nicht in den Datensatz aufgenommen.1 Diese technische Auswahl ist bei statistischen Analysen relevant: Der Bestand repräsentiert nicht sämtliche versuchten Eingaben, sondern veröffentlichte, erfolgreich verarbeitete Wettbewerbseinsendungen. Das Material erlaubt damit keine unmittelbare Aussage darüber, wie häufig einzelne Muster in einer beliebigen Produktivumgebung vorkommen.
Einsatz in der Praxis
Der Bezug erfolgt über Hugging Face. Die Metadaten weisen das Dataset als öffentlich, aber automatisch zugangsbeschränkt („gated: auto“) und im Parquet-Format aus; die Tags nennen die üblichen Zugangswege über datasets, pandas und Polars.3 Praktisch ist eine Zustimmung zu den Zugangsbedingungen erforderlich, bevor die Dateien und Inhalte bereitstehen.1 Für interne Tests kann der Datensatz als ein Baustein in einer kuratierten Testmenge dienen, etwa um einen Detektor oder eine Sicherheitsbewertung gegen historisch dokumentierte Muster zu prüfen.
Als alleinige Trainingsgrundlage wäre der Bestand jedoch methodisch ungeeignet. Die Prompts entstammen einem Wettbewerb mit klaren Zielaufgaben und genau drei damaligen Modellfamilien.12 Ein System kann auf enthaltene Formulierungsstile oder Aufgabenlogiken überangepasst werden, ohne neue Injektionen in anderen Sprachen, multimodale Inhalte oder agentische Tool-Ausgaben gleich gut zu erkennen. Sauberer ist eine zeitlich und semantisch getrennte Evaluation, ergänzt um eigene, defensiv erstellte Testfälle und Benchmarks wie AgentDojo.
Grenzen
Die Datensatzkarte benennt selbst wesentliche Risiken: Die Daten wurden vor Veröffentlichung nicht kuratiert und können anstößiges Material enthalten.1 Die Nutzung erfolgt ausdrücklich auf eigenes Risiko.1 Außerdem wurden personenbezogene Angaben nach Darstellung der Karte nicht direkt freigegeben; bei offiziellen Team-Einreichungen blieben Namen zur Wahrung der Privatsphäre unveröffentlicht.1 Für Redaktionen und Sicherheitsabteilungen folgt daraus, dass Verarbeitung, Zugriff und Anzeige des Rohmaterials kontrolliert werden sollten.
Die aktuelle öffentliche Revision trägt den SHA 25b87fbedfb86840abaf8cd09af7a029208a971a; die Metadaten nennen den 24. Januar 2024 als letzte Änderung.3 Diese lange unveränderte Revision ist kein Qualitätsurteil, aber ein klarer Hinweis darauf, dass der Datensatz historische Wettkampfdaten und keine fortlaufende Abdeckung neuer Modell- oder Angriffslandschaften bietet.3 Die EMNLP-Studie zeigt die Relevanz des Korpus für die damalige Forschung, nicht die Wirksamkeit einer konkreten heutigen Abwehr.2
Lizenz und Bezug
Die Plattform kennzeichnet den Datensatz mit der MIT-Lizenz; ein Preismodell ist nicht ausgewiesen.3 Für die Lizenz des Datenbestands ist dennoch die Zugangskarte maßgeblich, während Nutzungskosten bei eigener Speicherung, Verarbeitung oder ergänzenden Modell-APIs entstehen können. In den für diesen Beitrag geöffneten Primärquellen erscheint keine Übernahme- oder Einstellungsmitteilung. Der Dienst war zum Stichtag öffentlich und nicht deaktiviert.3
Quellen
- Learn Prompting / HackAPrompt, „Dataset Card for HackAPrompt“, Stand 20. August 2026, https://huggingface.co/datasets/hackaprompt/hackaprompt-dataset. ↩
- Schulhoff et al., „Ignore This Title and HackAPrompt: Exposing Systemic Vulnerabilities of LLMs Through a Global Prompt Hacking Competition“, EMNLP 2023, Dezember 2023, https://aclanthology.org/2023.emnlp-main.302/. ↩
- Hugging Face, „hackaprompt/hackaprompt-dataset – öffentliche Metadaten“, Abruf 20. August 2026, https://huggingface.co/api/datasets/hackaprompt/hackaprompt-dataset. ↩