OpenAI Moderation API
Die OpenAI Moderation API ist ein proprietärer Klassifikationsdienst für schädliche Inhalte in Text und Bildern. Das aktuelle Alias-Modell omni-moderation-latest liefert Kategorien, Scores und ein übergeordnetes flagged-Signal; Audio wird nicht klassifiziert.1 Es ist damit eine Inhaltsmoderation, kein spezialisierter Detektor für Prompt Injection oder eine Kontrolle, ob fremder Text die beabsichtigte Anwendungspolitik übernimmt.
Funktionsweise
Die API prüft eigenständige Texte oder Bilder über den Moderationsendpunkt. Alternativ kann eine Anwendung bei einem Responses-API-Aufruf Moderationssignale für Eingabe und erzeugte Ausgabe anfordern; die Antwort enthält dann getrennte Ergebnisobjekte.1 In beiden Fällen unterscheiden die Ergebnisse Kategorie-Flags, Scores zwischen null und eins und die Eingabetypen, auf die eine Kategorie angewandt wurde.1 Die Kategorien umfassen sexuelle Inhalte, Belästigung, Hass, unerlaubte Handlungen, Selbstverletzung und Gewalt, jeweils teils mit Unterkategorien.1
omni-moderation-latest wurde am 26. September 2024 als GPT-4o-basiertes, multimodales Moderationsmodell vorgestellt. OpenAI beschrieb damals Bildunterstützung für Gewalt, Selbstverletzung und sexuelle Inhalte mit der Ausnahme sexual/minors; weitere Kategorien waren textbasiert.2 Diese Detailgrenze ist für Integratoren maßgeblich: „nimmt Bilder an“ bedeutet nicht, dass jede Kategorie Bildmaterial bewertet. OpenAI bezeichnet Verbesserungen, unter anderem für nicht englische Sprachen, als Ergebnisse eigener interner Tests.2
Einsatz in der Praxis
Für bestehende OpenAI-Integrationen ist die Inline-Moderation attraktiv, weil sie neben der Generierung Resultate für Eingabe und Ausgabe liefert. Die Generierung läuft dabei dennoch normal weiter; OpenAI verlangt ausdrücklich, die Signale vor Anzeige oder nachgelagerten Maßnahmen auszuwerten.1 Für externe oder vorab abrufbare Inhalte kann dieselbe Moderationslogik über den eigenständigen Endpoint genutzt werden. Bilddateien dürfen laut Dokumentation bis zu 20 MB groß sein.1
Eine robuste Anwendung verwendet flagged nicht als unbesehenes Blockierungsurteil. OpenAI empfiehlt, zuerst dieses Signal und anschließend Kategorien und Scores für Protokollierung, Routing oder menschliche Review-Queues auszuwerten; auch eine sicherheitsorientierte Ablehnung kann wegen der bloßen Erwähnung schädlicher Inhalte markiert werden.1 Als geschlossene API eignet sie sich für Inhaltsrisiken in Ein- und Ausgaben, sollte in einer Agentenarchitektur aber mit Trennung von Daten und Instruktionen, Berechtigungskontrollen und gegebenenfalls einem spezialisierten Eingabefilter kombiniert werden.
Grenzen
Die Dokumentation nennt konkrete Abdeckungsgrenzen. Bei Tool-Aufrufen werden Argumente und Tool-Ausgaben nur erfasst, wenn sie als Gesprächsinhalt vorliegen; Toolnamen, Beschreibungen, Tool-Schemata und Response-Format-Schemata werden nicht moderiert.1 Beim Streaming treffen Scores erst ein, wenn die vollständige Ausgabe vorliegt, nicht mit den einzelnen Textdeltas.1 Das ist für Schnittstellen wichtig, die Inhalte unmittelbar während des Streamings anzeigen.
Die API dokumentiert keine Klasse „Prompt Injection“ und prüft die Kategorien schädlicher Inhalte, nicht die Herkunft oder Autorität einer Anweisung. Eine höflich formulierte, inhaltlich harmlose Anweisung kann daher inhaltlich unauffällig sein und trotzdem unerwünschte Programmsteuerung bezwecken. Das ist keine Schwäche eines einzelnen Scores, sondern eine Folge des dokumentierten Klassifikationsumfangs.1 Unabhängige, produktspezifische Untersuchungen von omni-moderation-latest waren in der geprüften Quellenbasis nicht ersichtlich; OpenAIs Leistungsangaben bleiben Herstellerangaben.
Lizenz und Bezug
Die API ist ein kommerzieller, proprietärer Plattformdienst; Modellgewichte werden nicht als Selbsthosting-Paket lizenziert. Der Moderationsendpunkt ist laut aktueller Dokumentation kostenlos nutzbar, unterliegt aber nutzungsstufenabhängigen Rate Limits.1 Das Preismodell beträgt damit für den Endpoint selbst 0 US-Dollar, nicht jedoch zwangsläufig für die Generierung oder übrige Plattformnutzung. Der Bezug erfolgt über ein OpenAI-API-Konto und die dokumentierte Schnittstelle.1
Quellen
- OpenAI, „Moderation | OpenAI API“, o. D., https://developers.openai.com/api/docs/guides/moderation ↩
- OpenAI, „Upgrading the Moderation API with our new multimodal moderation model“, 26. September 2024, https://openai.com/index/upgrading-the-moderation-api-with-our-new-multimodal-moderation-model/ ↩