Red Teaming
Red Teaming ist ein strukturierter Testansatz, bei dem ein KI-System gezielt mit adversarialen Szenarien konfrontiert wird, um Schwachstellen, unerwünschtes Verhalten und Missbrauchsrisiken aufzudecken. NIST definiert KI-Red-Teaming als strukturierten Testaufwand, der häufig adversariale Methoden nutzt und auch unvorhergesehene Systemverhalten erfasst.1 Es prüft nicht nur das Modell, sondern die konkrete Anwendung mit ihren Datenquellen, Prompts, Schnittstellen und Werkzeugen.
Einordnung
Ein Konfigurationsreview kann feststellen, ob eine Schutzmaßnahme vorhanden ist. Red Teaming untersucht dagegen, ob das System unter realistischen Gegenversuchen noch wie beabsichtigt reagiert. In LLM-Anwendungen umfasst das etwa Prüfungen gegen fremde Anweisungen in externen Inhalten, gegen unerwartete Werkzeugnutzung oder gegen eine Umgehung definierter Freigabegrenzen. Der Fokus liegt auf beobachtbarem Systemverhalten, nicht auf einer bloßen Zusicherung des Modellanbieters.
Red Teaming ist von einem einmaligen Penetrationstest abzugrenzen. Modellversionen, Systemprompts, Retrieval-Bestände und Werkzeugketten ändern sich fortlaufend; die Aussage eines Tests ist daher zeitgebunden. NIST nennt automatisierte Schwachstellenbewertungen, gezieltes Experten-Red-Teaming und Bug-Bounty-Programme als mögliche Evaluierungsformen. Zugleich warnt der Bericht, dass Tests Schwachstellen unterschätzen können, die Akteuren mit mehr Zeit, Ressourcen oder Glück zugänglich wären.1
Dokumentiertes Beispiel
Das NIST-Dokument zur adversarialen Machine-Learning-Taxonomie hält ausdrücklich fest, dass Evaluierungen den Zustand eines Modells zu einem bestimmten Zeitpunkt messen. Neue Angriffstechniken, zusätzliche Daten nach dem Training oder veränderte Modellfähigkeiten können das Ergebnis später verändern; NIST leitet daraus die Bedeutung kontinuierlicher Evaluationen ab.1 Dieser Befund erklärt, weshalb belastbares Red Teaming aus wiederholbaren Tests und nicht aus einer Einzelprüfung besteht.
Das NIST-Profil für generative KI ist ein freiwilliges Begleitdokument zum AI Risk Management Framework. Es soll Organisationen dabei unterstützen, Vertrauenswürdigkeitsaspekte in Entwurf, Entwicklung, Nutzung und Bewertung generativer KI-Systeme einzubeziehen.2 Es ist kein Produktzertifikat und keine Zusicherung einer bestimmten Abwehrquote.
Bedeutung für die Abwehr
Ein wirksames Programm definiert zuerst kritische Systemgrenzen: untrusted content, sensible Daten, Werkzeuge und wirksame Ausgaben. Darauf folgt ein versionierter Testsatz mit klaren Erfolgskriterien, etwa für Angriffserfolgsquote, Fehlalarme und unzulässige Werkzeugaktionen. Vor einem Modell- oder Architekturwechsel muss derselbe Satz erneut laufen. Ergebnisse sollten einer verantwortlichen Stelle zugeordnet, mit Schweregrad versehen und bis zur Behebung nachverfolgt werden. So wird aus Red Teaming ein messbarer Regressionsschutz und nicht lediglich eine einmalige Übung.
Quellen
- Apostol Vassilev et al., „Adversarial Machine Learning: A Taxonomy and Terminology of Attacks and Mitigations“, März 2025, https://nvlpubs.nist.gov/nistpubs/ai/NIST.AI.100-2e2025.pdf ↩
- Chloe Autio et al., „Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile“, 26. Juli 2024, https://www.nist.gov/publications/artificial-intelligence-risk-management-framework-generative-artificial-intelligence ↩