Leitfaden zur Optimierung der GPT Image Moderation: So reduzieren Sie 400-Fehler bei moderation_blocked

CryptoCrypto
·18. September 2026·9 Min. Lesezeit·Aktualisiert 18. September 2026·26 Aufrufe
#GPT Image#Bildgenerierung#Inhaltsmoderation#Prompt Engineering#API-Leitfaden
Leitfaden zur Optimierung der GPT Image Moderation: So reduzieren Sie 400-Fehler bei moderation_blocked

Wenn Sie Bilder mit GPT Image-Modellen (gpt-image-2, gpt-image-2.5) in größerem Umfang generieren, werden Sie irgendwann auf einen frustrierenden Fehler stoßen: HTTP 400 und die Meldung, dass Ihre Anfrage vom Sicherheitssystem abgelehnt wurde. Kein Bild, keine Teilausgabe und ein Prompt, der für Sie völlig angemessen aussah.

Dieser Leitfaden erklärt, was dieser Fehler eigentlich ist, was ihn in der Praxis auslöst und wie Sie Prompts und Referenzbilder optimieren können, damit er seltener auftritt. Er basiert auf 30 Tagen Produktionsdaten der TokenLab Image-API (19. August – 18. September 2026) sowie der offiziellen Dokumentation zur Bildgenerierung von OpenAI. Wo wir Zahlen nennen, handelt es sich um aggregierte Plattformstatistiken; Kundeninhalte werden nicht reproduziert.

Was der Fehler eigentlich ist

GPT Image-Modelle filtern jeden Prompt, jedes Eingabebild und jedes generierte Bild anhand der Inhaltsrichtlinien des Anbieters. Wenn ein Filter ausgelöst wird, schlägt die Anfrage mit einem 400-Fehler fehl, dessen stabiler Diskriminator der Fehlercode ist:

{
  "error": {
    "type": "image_generation_user_error",
    "code": "moderation_blocked",
    "moderation_details": {
      "moderation_stage": "input",
      "categories": ["sexual"]
    }
  }
}

Gemäß der offiziellen Dokumentation ist moderation_details optional und bewusst grob gehalten: moderation_stage gibt an, ob die Blockierung von Ihren Eingaben (input) oder vom generierten Bild (output) stammt, und categories enthält allgemeine öffentliche Bezeichnungen wie harassment (Belästigung), self-harm (Selbstverletzung), sexual (sexuell) oder violence (Gewalt). Interne Klassifizierungs-Scores werden nie offengelegt.

Auf TokenLab tritt dasselbe Ereignis in zwei Formen auf:

  • Synchrone Aufrufe (/v1/images/generations, /v1/images/edits) geben sofort HTTP 400 zurück.
  • Asynchrone Aufgaben wechseln in den Status failed mit der Meldung "The request was rejected by the safety system."

In jedem Fall sind zwei betriebliche Fakten wichtig. Erstens ist eine Moderationsblockierung für denselben Inhalt deterministisch: Ein unveränderter Wiederholungsversuch ist so gut wie nie erfolgreich. Zweitens wird auf TokenLab eine durch Moderation blockierte Aufgabe als fehlgeschlagene Aufgabe behandelt und das vorab abgezogene Kontingent wird automatisch vollständig erstattet — Sie zahlen nie für eine blockierte Generierung.

Dreißig Tage Produktionsdaten

Zwischen dem 19. August und dem 18. September 2026 wurden etwa 4,3 % der GPT Image-Aufgaben auf TokenLab — grob eine von 23 — vom vorgelagerten Sicherheitssystem abgelehnt. Die Verteilung ist nicht zufällig; die blockierten Anfragen häufen sich stark um einige wenige Muster:

SignalBlockierte AufgabenAlle anderen AufgabenBedeutung
Prompt erwähnt Minderjährige (Kind, Baby, "7-jährig", ...)79%33%Stärkster Einzelindikator
Fotorealistische Formulierungen ("fotorealistisch", "echter Mensch", "Live-Action")77%57%Verstärker, besonders bei Minderjährigen
Sexuell angehauchte Deskriptoren (nackt, sexy, Dessous, körperbezogene Formulierungen)43%17%Starker Indikator
Allgemeine Aktions-/Gewaltbegriffe (Schlacht, Schwert, Explosion)~50%~50%Kein Vorhersagewert für sich allein

Drei weitere Erkenntnisse aus demselben Zeitraum:

  • Referenzbilder erhöhen das Risiko. Aufgaben mit Eingabe-/Referenzbildern wurden zu 8,4 % blockiert, gegenüber 3,7 % bei reiner Textgenerierung — mehr als doppelt so viel. Bilder werden genauso streng moderiert wie Text.
  • Lange Prompts scheitern häufiger. Blockierte Prompts waren durchschnittlich etwa 3.600 Zeichen lang, und über die Hälfte überschritt 2.000 Zeichen. Jede zusätzliche Klausel bietet mehr Angriffsfläche für einen Klassifikator.
  • Wiederholungsversuche waren nie erfolgreich. Jede blockierte Aufgabe in diesem Zeitraum endete in einem endgültigen Fehlerzustand; keine war durch erneutes Einreichen derselben Eingabe erfolgreich. Und jede einzelne wurde automatisch erstattet.

Der am häufigsten blockierte Workflow, den wir beobachtet haben: fotorealistische Charakter-Design-Sheets von Minderjährigen — Prompts im Stil von "Casting-Referenzen", die einen kindlichen Charakter mit ultra-realistischer Darstellung, präzisen Körperproportionen und Kleidungshinweisen beschreiben. Prompts, die Vokabular zu Minderjährigen mit fotorealistischer Darstellung kombinieren, wurden zu ~9,5 % blockiert, das 2,2-fache der Basisrate.

Fünf Muster, die Blockierungen auslösen

Bei der Durchsicht der blockierten Population fällt fast jede Ablehnung in eine dieser Kategorien:

  1. Fotorealistische Darstellungen von Minderjährigen. Kinder- oder Baby-Charaktere, die als "ein echter Mensch, fotografiert im Studio", "ultra-fotorealistisch", "kein CGI, keine Illustration" dargestellt werden. Die Kombination aus Minderjährigem und Fotorealismus ist die am stärksten geschützte Grenze in der Bildmoderation, und sie greift selbst dann, wenn die Absicht ein unschuldiges Charakter-Sheet ist.
  2. Kleidungs- oder körperbezogene Formulierungen bei Minderjährigen. Phrasen wie "unbekleidet, Nahaufnahme ab Schlüsselbein" (gedacht als einfacher Porträtausschnitt) oder detaillierte Körpermaßangaben von Kopf bis Fuß bei einem Kindercharakter. Individuell unschuldig, wirken sie in der Summe wie eine körperbezogene Beschreibung eines Minderjährigen.
  3. Sexualisierte Deskriptoren bei erwachsenen Charakteren. Auf Pose, Haut und Unterwäsche fokussiertes Vokabular ("Dessous", "nackt", "verführerische Pose"), selbst in ansonsten SFW-Kompositionen (Safe For Work).
  4. Grafische anatomische Gewalt. Horror- und Dark-Fantasy-Prompts, die verrottendes Fleisch, freiliegende Organe, offene Wunden oder Parasiten anatomisch detailliert beschreiben.
  5. Referenzbilder von echten Personen. Echte Fotos von Minderjährigen, Bilder mit hoher Hautfreilegung oder Gesichter, die Prominenten ähneln, wenn sie als Bearbeitungseingabe verwendet werden.

Zwei Verstärker machen alles oben Genannte anfälliger für Blockierungen: sehr lange Prompts (mehr Text bedeutet mehr Möglichkeiten für eine ungünstige Kombination) und Negativ-Wortlisten. Eine Zeile wie "keine Nacktheit, keine sexuellen Inhalte, keine Gewalt" beruhigt den Klassifikator nicht — sie wiederholt die Konzepte, die Sie vermeiden möchten, und fügt sie der Eingabe hinzu. Beschreiben Sie, was Sie wollen, nicht das, was Sie nicht wollen.

Das Prompt-Optimierungs-Playbook

Dies sind die Umschreibungsstrategien, die auf den Daten basieren. (Beispiele dienen der Veranschaulichung, nicht dem Kundenverkehr.)

1. Halten Sie Minderjährige vom Fotorealismus fern

Wenn Ihre Geschichte, Ihr Comic oder Ihr Spiel Kindercharaktere erfordert, stellen Sie diese in einem klar stilisierten Medium dar:

Vorher: "Ultra-fotorealistisches Casting-Foto eines 7-jährigen Mädchens, echter menschlicher
Kind im Studio fotografiert, detaillierte Körperproportionen, Nahaufnahme ab Schlüsselbein
unbekleidetes Gesicht ..."

Nachher: "Aquarell-Illustration aus einem Bilderbuch eines jungen Mädchens in Kleidung der
Ming-Dynastie, Porträt ab Schulter, rundes Gesicht, zwei Haarknoten mit Stoffbändern gebunden,
sanfter Ausdruck, schlichter weißer Hintergrund"

Ändern Sie das Medium (Aquarell, 2D-Animation, 3D-Cartoon, Bilderbuchstil), lassen Sie den Rahmen "echter Mensch / fotografiert" weg und überspringen Sie Körpermaße vollständig. Wenn Sie Kleidung beschreiben müssen, beschreiben Sie, was der Charakter trägt ("trägt eine Jacke mit Rundhalsausschnitt"), anstatt was er nicht trägt.

2. Löschen Sie Negativ-Wortlisten

Ersetzen Sie "keine Nacktheit, kein Blut, kein Text, kein Wasserzeichen" durch positive Formulierungen: "vollständig bekleidet", "saubere Komposition", "schlichter Hintergrund". Behalten Sie nur Negative bei, die keine eingeschränkte Kategorie benennen (z. B. "kein Wasserzeichen" ist in Ordnung; "keine Nacktheit" hilft nicht).

3. Kürzen Sie den Prompt

Wenn Sie mehrteilige Charakter-Sheets generieren, wiederholen Sie nicht denselben Stilblock in jeder Panel-Beschreibung. Ein gemeinsamer Stilsatz plus panelspezifische Details hält Sie unter der Schwellenwert-Oberfläche, bei der zufällige Auslöserkombinationen wahrscheinlich werden.

4. Entschärfen Sie Gewalt durch Atmosphäre, nicht durch Anatomie

Vorher: "ihr Körper verrottend, freiliegender Schädel, Fleisch, Pusteln und Parasiten ..."

Nachher: "eine Hälfte gelassen und mütterlich, die andere Hälfte löst sich in Schatten
und Gezeitennebel auf, Verfall angedeutet durch Silhouette und Beleuchtung statt durch
anatomische Details"

Dark Fantasy übersteht die Moderation, wenn der Horror durch Stimmung, Beleuchtung und Silhouette statt durch gewebeartige Beschreibungen transportiert wird.

5. Neutralisieren Sie die Nähe zu Inhalten für Erwachsene

Tauschen Sie bei erwachsenen Charakteren körper- und unterwäschebezogene Wörter gegen Mode- und Stimmungssprache aus: "Abendkleid" statt "Dessous", "selbstbewusster Kontrapost" statt "verführerische Pose".

Hygiene bei Referenzbildern

Da Bildeingaben ebenfalls moderiert werden — und in unseren Daten die Blockierrate mehr als verdoppeln —, behandeln Sie Referenzbilder als Teil des Prompts:

  • Bevorzugen Sie stilisierte Referenzen für Minderjährige. Eine Illustration oder ein 3D-Render eines Kindercharakters ist eine weitaus sicherere Eingabe als ein echtes Foto eines Kindes und funktioniert normalerweise genauso gut für die Charakterkonsistenz.
  • Zuschneiden auf das Wesentliche. Wenn Sie ein Gesicht für die Identitätskonsistenz benötigen, laden Sie den Gesichtsausschnitt hoch, kein Ganzkörper-Strandfoto. Weniger Haut und weniger Kontext bedeuten weniger Angriffsfläche für den Klassifikator.
  • Entfernen Sie überlagerte Texte und Wasserzeichen. Bildunterschriften, Meme-Texte und Wasserzeichen-Strings auf Referenzbildern werden als Eingabetext gelesen und können Auslöserwörter enthalten, von denen Sie vergessen haben, dass sie dort waren.
  • Vermeiden Sie echte Prominenten-Ähnlichkeiten, sowohl als Referenzbilder als auch als "im Stil von "-Prompt-Text.

Der Moderationsparameter

GPT Image-Modelle akzeptieren gemäß der offiziellen Dokumentation einen moderation-Parameter mit zwei Werten:

  • auto (Standard): Standardfilterung, die bestimmte Kategorien potenziell altersunangemessener Inhalte einschränkt.
  • low: weniger restriktive Filterung.

TokenLab leitet diesen Parameter sowohl bei /v1/images/generations als auch bei /v1/images/edits weiter:

curl https://api.tokenlab.sh/v1/images/generations \
  -H "Authorization: Bearer $TOKENLAB_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-image-2",
    "prompt": "Aquarell-Illustration aus einem Bilderbuch eines jungen Mädchens in Kleidung der Ming-Dynastie, Porträt ab Schulter",
    "size": "1024x1024",
    "moderation": "low"
  }'

Verwenden Sie low, wenn Ihr Inhalt eindeutig harmlos ist, aber immer wieder markiert wird — stilisierte Illustrationsarbeit ist der klassische Fall. Zwei Warnungen: low ist nicht off (illegale Kategorien wie CSAM werden immer blockiert), und es ist ein Regler, keine Garantie — korrigieren Sie zuerst den Prompt, dann greifen Sie zum Parameter.

Umgang mit Blockierungen im Code

Die offizielle Empfehlung ist eindeutig: image_generation_user_error-Fehler sind vom Benutzer korrigierbar und sollten nicht ohne Änderung der Anfrage wiederholt werden. Unsere Daten bestätigen dies — keine blockierte Aufgabe im 30-Tage-Zeitraum war durch einen Wiederholungsversuch mit unveränderter Anfrage erfolgreich. Der richtige Umgang:

  • Unterscheiden Sie nach error.code, nicht nach dem Nachrichtentext. Nur moderation_blocked (und image_generation_user_error im Allgemeinen) bedeutet "Eingabe korrigieren". Ratenbegrenzungen und 5xx-Fehler sind weiterhin wiederholbar.
  • Lesen Sie die Stufe. moderation_stage: "input" bedeutet, den Prompt umzuschreiben oder das Referenzbild auszutauschen; "output" bedeutet, dass das generierte Bild selbst markiert wurde — ein erneuter Versuch mit einem leicht angepassten, risikoärmeren Prompt löst dies normalerweise.
  • Halten Sie die Endbenutzermeldung allgemein ("Diese Anfrage konnte aufgrund von Sicherheitsanforderungen für Inhalte nicht abgeschlossen werden") und protokollieren Sie moderation_details sowie die Anfragen-ID für Ihr eigenes Debugging und Support.
  • Keine Endlosschleifen. Brechen Sie nach einer Moderationsblockierung pro eindeutiger Eingabe ab; das erneute Einreichen identischer Inhalte verschwendet Latenzzeit und Debugging-Zeit, auch wenn TokenLab es erstattet.

Checkliste

Ihre SituationWahrscheinlicher AuslöserLösung
Design-Sheet für KindercharakterMinderjähriger × FotorealismusStilisiertes Medium, keine Körpermaße, positive Kleidungswortwahl
Fotorealistisches Porträt eines Erwachsenen blockiertSexualisierte DeskriptorenMode-/Stimmungswortwahl; erwägen Sie moderation="low"
Dark Fantasy / Horror-KreaturAnatomische GewaltAtmosphäre und Silhouette statt Gewebedetails
Bearbeitung mit Referenzfoto blockiertEchte Person / hautlastiges EingabebildEnger zuschneiden, stilisierte Referenz verwenden, Overlay-Text entfernen
Langer mehrteiliger Prompt blockiertPrompt-Oberfläche + NegativlistenBoilerplate deduplizieren, Negativ-Wortlisten löschen
Harmlose stilisierte Arbeit dennoch markiertKonservatismus des Klassifikatorsmoderation="low"

FAQ

Zahle ich für eine blockierte Generierung? Nein. Auf TokenLab schlagen durch Moderation blockierte Aufgaben fehl und das vorab abgezogene Kontingent wird automatisch und vollständig erstattet.

Hilft es, denselben Prompt erneut zu versuchen? Nein. In 30 Tagen Daten war keine einzige blockierte Aufgabe bei einem unveränderten Wiederholungsversuch erfolgreich. Ändern Sie zuerst die Eingabe.

Deaktiviert moderation="low" die Sicherheitsfilterung? Nein. Es reduziert die Restriktivität; illegale Inhaltskategorien bleiben unabhängig davon blockiert.

Werden Referenzbilder wirklich moderiert? Ja — sowohl der Prompt als auch jedes Eingabebild werden gefiltert, und Aufgaben mit Referenzbildern wurden in unseren Daten mehr als doppelt so häufig blockiert wie bei reiner Textgenerierung.

Kann ich genau sehen, welche Regel ausgelöst wurde? Nur auf der groben Ebene von moderation_details.categories, und nur wenn der vorgelagerte Dienst dies einschließt. Anbieter legen interne Klassifizierungsdetails bewusst nicht offen.

Einschränkungen

Die oben genannten Statistiken sind 30-Tage-Aggregate aus dem Produktionsverkehr von TokenLab und beschreiben Tendenzen, keine Garantien; Moderationsklassifikatoren ändern sich im Laufe der Zeit, und derselbe Prompt kann nach einem vorgelagerten Update anders behandelt werden. Die Umschreibungsbeispiele sind illustrative Vorlagen, keine Kundendaten. Validieren Sie immer anhand des aktuellen Verhaltens mit einem kleinen Test, bevor Sie einen Batch-Lauf starten.

Um diese Modelle auszuprobieren, durchsuchen Sie den Bildmodell-Katalog, lesen Sie den Leitfaden zur asynchronen Bildgenerierung für die Handhabung des Aufgabenlebenszyklus und prüfen Sie docs.tokenlab.sh für das aktuelle Anfrageformat.

Teilen:

Neue öffentliche Modelle

Mit den Modellen aus diesem Leitfaden bauen

Preise vergleichen, Routen testen und aus der Recherche einen laufenden API-Aufruf machen.