Die Preisgestaltung für Batch-Inferenz funktioniert nach dem Prinzip, Antwortlatenz gegen einen niedrigeren Preis pro Token einzutauschen: Sie übermitteln einen Job, der Anbieter verarbeitet ihn innerhalb eines definierten Zeitfensters (üblicherweise bis zu 24 Stunden) und Sie zahlen weniger als für einen synchronen Echtzeit-Aufruf. Ob sich dieser Tausch lohnt, hängt vollständig davon ab, ob Ihre Arbeitslast die Wartezeit tolerieren kann.
Dieser Artikel vergleicht Batch-Inferenz (asynchron) mit standardmäßigen synchronen API-Aufrufen auf Basis der von OpenAI und Google veröffentlichten Batch-API-Dokumentation und legt einen Entscheidungsrahmen fest, wann der asynchrone Weg für Ihr Produkt tatsächlich Kosten spart.
Wichtige Erkenntnisse
- OpenAI und Gemini veröffentlichen beide eine Batch-API, die Jobs zur asynchronen Verarbeitung zu einem rabattierten Preis gegenüber synchronen Aufrufen akzeptiert; bestätigen Sie den genauen aktuellen Rabattprozentsatz auf der Preisseite des jeweiligen Anbieters, bevor Sie budgetieren, da sich die Preise ändern können.
- Batch-Inferenz eignet sich für Arbeitslasten, die ein Bearbeitungsfenster tolerieren, anstatt eine sofortige Antwort zu benötigen: Massenklassifizierung, Erstellung von Embeddings, Offline-Evaluierung, Datensatz-Labeling und Backfill-Jobs.
- Echtzeit-Chat, Coding-Agenten und interaktive Produktfunktionen eignen sich im Allgemeinen nicht für Batch-Preise, da das Verarbeitungsfenster sie für die Live-Interaktion mit Benutzern unbrauchbar macht.
- Die größten kumulativen Einsparungen ergeben sich meist aus der Kombination von Batch-Rabatten mit der Modellauswahl und der Optimierung von Prompts; siehe /models/rankings und den Leitfaden zur Senkung von AI-API-Kosten für weitere Hebel.
Was Batch-Inferenz tatsächlich bedeutet
Synchrone API-Aufrufe liefern eine Antwort, sobald das Modell die Generierung abgeschlossen hat, typischerweise innerhalb von Sekunden. Sie zahlen einen Preis pro Token, der an diese Unmittelbarkeit gebunden ist. Batch-Inferenz kehrt das Modell um: Anstatt eines einzelnen Anfrage-Antwort-Austauschs übermitteln Sie eine Datei oder eine Liste von Anfragen als Job. Der Anbieter stellt den Job in eine Warteschlange, verarbeitet ihn innerhalb eines von ihm kontrollierten Zeitfensters und stellt die Ergebnisse bereit, sobald sie fertig sind.
Dies ist keine neue Inferenztechnik innerhalb des Modells. Es ist ein anderer kommerzieller und operativer Vertrag. Der Anbieter kann Ihre Arbeitslast gegen freie oder Nebenzeiten-Kapazitäten planen und berechnet im Gegenzug weniger pro Token als für eine Anfrage, die sofort bedient werden muss.
Sowohl OpenAI als auch Google dokumentieren dieses Muster für ihre jeweiligen APIs:
- Die Referenz zur Batch-API von OpenAI beschreibt das Erstellen eines Batch-Objekts aus einer hochgeladenen Anfragedatei, das Verfolgen des Status und das Abrufen der Ausgabe nach Abschluss des Jobs (platform.openai.com/docs/api-reference/batch/object).
- Die Dokumentation zur Gemini Batch-API von Google beschreibt ein vergleichbares Modell: Einreichen eines Batches von Anfragen, der Job läuft asynchron und die Ergebnisse werden nach der Verarbeitung abgerufen (ai.google.dev/gemini-api/docs/batch-api).
Die Mechanismen unterscheiden sich geringfügig zwischen den Anbietern (dateibasierte Übermittlung, Job-Objekte, Status-Polling, Abrufen der Ausgabe), aber die grundlegende Form ist konsistent: Jetzt einreichen, später abholen, weniger pro Token zahlen als beim synchronen Äquivalent. Überprüfen Sie die aktuelle Dokumentation jedes Anbieters auf das genaue Verarbeitungsfenster und den Rabattsatz, der für Ihr Konto und Ihr Modell gilt, da diese Details anbieterspezifisch sind und sich ändern können.
Wie die beiden dokumentierten Batch-APIs funktionieren
Auf mechanischer Ebene folgen beide Anbieter einem ähnlichen Lebenszyklus:
- Anfragen vorbereiten. Sie stellen die einzelnen Inferenzanfragen zusammen, die verarbeitet werden sollen, typischerweise formatiert als Datei (OpenAI akzeptiert eine Datei mit Anfragen, die durch eine benutzerdefinierte ID gekennzeichnet sind; Gemini akzeptiert einen Batch strukturierter Anfragen).
- Job einreichen. Sie erstellen ein Batch-Objekt oder eine Job-Ressource, die auf Ihre hochgeladene Eingabe verweist.
- Pollen oder auf Abschluss warten. Der Job durchläuft Zustände (in Warteschlange, in Bearbeitung, abgeschlossen oder fehlgeschlagen), bis der Anbieter die Verarbeitung innerhalb seines dokumentierten Fensters beendet.
- Ausgabe abrufen. Sobald der Vorgang abgeschlossen ist, laden Sie die Ausgabedatei oder den Ergebnissatz herunter oder rufen ihn ab, wobei jede Antwort über die ID ihrer ursprünglichen Anfrage zugeordnet wird.
Keiner der Anbieter verarbeitet Batch-Jobs sofort. Das ist der ganze Punkt des Preismodells: Der Job läuft nach dem Zeitplan des Anbieters, nicht nach Ihrem, und Sie akzeptieren eine begrenzte Verzögerung im Austausch für einen niedrigeren Preis. Wenn Ihr Produkt diese Verzögerung nicht tolerieren kann, steht Ihnen die Batch-Preisgestaltung nicht zur Verfügung, unabhängig davon, wie viel Sie auf dem Papier sparen würden.
Wann Batch-Preise Geld sparen: Eine Entscheidungs-Checkliste
Verwenden Sie diese Checkliste, bevor Sie eine Arbeitslast an einen Batch-Endpunkt leiten:
- Hat die Arbeitslast eine natürliche, nicht-interaktive Form? Klassifizierungsdurchläufe über einen Datensatz, Embedding-Generierung für ein Dokumentenkorpus, Content-Moderations-Scans oder nächtliche Zusammenfassungs-Jobs passen alle.
- Kann Ihr Produkt das dokumentierte Verarbeitungsfenster tolerieren? Wenn ein Benutzer oder ein nachgelagertes System das Ergebnis innerhalb von Sekunden oder Minuten benötigt, ist Batch nicht geeignet.
- Ist das Volumen groß genug, damit es ins Gewicht fällt? Batch-Rabatte gelten pro Token, daher skalieren die absoluten Einsparungen mit dem Volumen. Eine Handvoll Anfragen wird Ihre Rechnung in keiner der beiden Richtungen nennenswert verändern.
- Ist die Aufgabe idempotent oder sicher wiederholbar? Da Batch-Jobs asynchron laufen und teilweise fehlschlagen können, muss Ihre Pipeline eine erneute Einreichung oder einen teilweisen Abschluss bewältigen können, ohne den nachgelagerten Status zu beschädigen.
- Unterstützt Ihre Orchestrierungsschicht bereits asynchrones Job-Polling? Wenn Sie dieses Muster zum ersten Mal aufbauen, planen Sie Engineering-Zeit für die Job-Einreichung, das Status-Polling und die Ausgabekonsolidierung ein.
| Dimension | Synchrone API | Batch-API (asynchron) |
|---|---|---|
| Latenz | Typischerweise Sekunden | Minuten bis Stunden, begrenzt durch das dokumentierte Fenster des Anbieters |
| Preisgestaltung | Standard-Preis pro Token | Rabattierter Preis pro Token gegenüber synchron, gemäß Anbieterdokumentation |
| Beste Eignung | Chat, Agenten, Live-Produktfunktionen | Massenklassifizierung, Embeddings, Offline-Evaluierung, Backfills |
| Fehlerbehandlung | Sofortiger Fehler beim Aufruf | Job-Status; Teilfehler innerhalb eines Batches möglich |
| Engineering-Aufwand | Einfache Anfrage-Antwort | Erfordert Logik für Job-Einreichung, Polling und Ausgabeabruf |
| Ausgabereihenfolge | Entspricht der Aufrufreihenfolge | Abgleich über benutzerdefinierte Anfrage-ID, nicht Aufrufreihenfolge |
Wann Batch-Preise nicht passen
Batch-Inferenz ist für alles ungeeignet, bei dem eine Person oder ein nachgelagertes System auf die Antwort wartet. Dazu gehören:
- Konversations-Agenten und Chat-Produkte. Ein Benutzer erwartet eine Antwort in Sekunden, nicht nach einem Verarbeitungsfenster.
- Coding-Assistenten und agentische Coding-Workflows. Tools, die auf Modellen wie Claude Sonnet 5 oder Kimi K2.7 Code basieren, hängen von engen Feedbackschleifen zwischen dem Entwickler und dem Modell ab; Batching würde die Interaktion vollständig unterbrechen.
- Echtzeit-Content-Generierung für benutzerorientierte Funktionen, einschließlich On-Demand-Bild- oder Videogenerierung über APIs wie Nano Banana Pro oder Veo 3, bei denen der Benutzer eine Fortschrittsanzeige beobachtet.
- Alles mit einer Service-Level-Anforderung an die Latenz, selbst wenn diese Anforderung locker ist (z. B. unter einer Minute). Batch-Fenster werden typischerweise in Stunden gemessen, nicht in Sekunden.
Wenn ein Teil Ihrer Pipeline in Echtzeit abläuft und ein anderer nicht, teilen Sie die Arbeit auf. Leiten Sie den interaktiven Teil über die synchrone API und schieben Sie den massenhaften, verzögerungstoleranten Teil (nächtliche Neuindizierung, Datensatz-Labeling, Evaluierungsläufe) an den Batch-Endpunkt.
Eine praktische Anfrage-Form
Das genaue Schema unterscheidet sich zwischen dem Batch-Objekt von OpenAI und der Batch-API von Gemini. Betrachten Sie das Folgende daher eher als illustrative Form und nicht als wörtliche Kopie des Anfrageformats eines der beiden Anbieter. Bestätigen Sie die genauen Feldnamen und Endpunkte anhand der aktuellen Dokumentation, bevor Sie dies implementieren.
# 1. Vorbereiten einer Anfragedatei, jede mit einer benutzerdefinierten ID
{"custom_id": "req-001", "method": "POST", "url": "/v1/chat/completions",
"body": {"model": "your-selected-model", "messages": [{"role": "user", "content": "Classify this ticket."}]}}
{"custom_id": "req-002", "method": "POST", "url": "/v1/chat/completions",
"body": {"model": "your-selected-model", "messages": [{"role": "user", "content": "Classify this ticket."}]}}
# 2. Batch-Job einreichen
POST /v1/batches
{
"input_file_id": "file-abc123",
"endpoint": "/v1/chat/completions",
"completion_window": "24h"
}
# 3. Job-Status abfragen
GET /v1/batches/{batch_id}
# gibt Status zurück: queued | in_progress | completed | failed
# 4. Ausgabe nach Abschluss abrufen
GET /v1/files/{output_file_id}/content
# jede Antwort über custom_id mit der ursprünglichen Anfrage abgleichen
Das grundlegende Engineering-Muster ist unabhängig vom Anbieter gleich: Erstellen Sie Ihre Anfragedatei mit stabilen IDs, reichen Sie den Job ein, pollen Sie auf Abschluss und gleichen Sie die Ausgabe mit Ihrer ursprünglichen Anfrageliste ab. Bauen Sie eine Wiederholungslogik für Teilfehler auf Job-Ebene ein, da ein Batch mit einigen fehlgeschlagenen Einzelanfragen abgeschlossen werden kann, selbst wenn der Job selbst erfolgreich ist.
Kombination von Batch-Rabatten mit Modellauswahl
Die Batch-Preisgestaltung ist ein Hebel. Sie ergänzt die Entscheidungen auf Modell- und Prompt-Ebene, die in AI model routing benchmark und AI API cost reduction guide behandelt werden, anstatt sie zu ersetzen. Eine Arbeitslast, die sowohl Batch-fähig ist als auch von einem kostengünstigeren Modell wie DeepSeek V4 Flash, GLM-5.2 oder Gemini 3.5 Flash für routing-freundliche Aufgaben bedient wird, wird typischerweise größere absolute Einsparungen erzielen, als wenn nur einer der Hebel angewendet wird. Bevor Sie einen großen Massenjob einem einzelnen Modell und einer Preisstufe zuweisen, überprüfen Sie die aktuelle Preisgestaltung und Positionierung pro Modell unter /models/rankings, da sich die relative Preisgestaltung zwischen Frontier- und Low-Cost-Modellen verschiebt, wenn Anbieter ihr Portfolio aktualisieren.
Für Teams, die bewerten, ob sie überhaupt Batch-Unterstützung aufbauen sollen, ist die Berechnung einfach: Schätzen Sie Ihr monatliches Token-Volumen für verzögerungstolerante Aufgaben, vergleichen Sie den dokumentierten Batch-Rabatt mit Ihren aktuellen synchronen Ausgaben für dasselbe Volumen und wägen Sie dies gegen die Engineering-Kosten für den Aufbau der Job-Einreichungs- und Polling-Logik ab. Wenn das Volumen gering ist, deckt der Rabatt die zusätzliche Komplexität möglicherweise nicht ab.
Einschränkungen
Dieser Vergleich basiert auf den allgemeinen Mechanismen, die von OpenAI und Google für ihre Batch-APIs dokumentiert wurden, wie am 14.07.2026 beobachtet. Genaue Rabattprozentsätze, Längen der Verarbeitungsfenster, Verfügbarkeit pro Modell und Anforderungen an das Dateiformat sind anbieterspezifisch, ändern sich im Laufe der Zeit und werden hier nicht als feste Zahlen wiederholt. Überprüfen Sie die aktuelle Batch-Preisgestaltung und die Bedingungen direkt anhand der Dokumentation jedes Anbieters, bevor Sie budgetieren oder entwickeln. Dieser Artikel behandelt auch nicht die Batch-Unterstützung jedes Modellanbieters; prüfen Sie, ob Ihr gewähltes Modell und Ihr Anbieter überhaupt einen Batch-Endpunkt veröffentlichen, bevor Sie darauf planen.
FAQ
Wie viel günstiger ist Batch-Inferenz als synchrone Aufrufe? Sowohl OpenAI als auch Google dokumentieren einen Rabatt für die Batch-Verarbeitung im Verhältnis zu ihrem standardmäßigen synchronen Preis, aber der genaue Prozentsatz ist anbieter- und zeitspezifisch. Überprüfen Sie die aktuelle Preisseite für Ihren Anbieter und Ihr Modell, bevor Sie Einsparungen schätzen.
Was passiert, wenn mein Batch-Job nicht innerhalb des Verarbeitungsfensters fertig wird? Die Dokumentation der Anbieter beschreibt Job-Statuszustände (wie queued, in progress, completed und failed). Überprüfen Sie die Dokumentation jedes Anbieters dazu, wie er mit Jobs umgeht, die das Abschlussfenster überschreiten, da das Verhalten je nach Anbieter unterschiedlich sein kann und sich ändern kann.
Kann ich Batch-Inferenz für Echtzeit-Chat-Funktionen verwenden? Nein. Batch-Jobs werden asynchron innerhalb eines Fensters verarbeitet, das von Minuten bis zu vielen Stunden reichen kann, was sie für Arbeitslasten ungeeignet macht, bei denen ein Benutzer oder System auf eine sofortige Antwort wartet. Verwenden Sie die synchrone API für interaktive Funktionen und reservieren Sie Batch-Endpunkte für verzögerungstolerante Aufgaben mit hohem Volumen.
Wenn Sie bewerten, ob Batch-Preise zu Ihrer Arbeitslast passen, vergleichen Sie die aktuellen Raten und Rankings pro Modell und beginnen Sie dann damit, Ihre verzögerungstoleranten Jobs anhand der obigen Checkliste abzubilden, bevor Sie Engineering-Zeit in die Job-Einreichungs- und Polling-Logik investieren.
Quellen
Preis geprüft am 2026-07-14
- Gemini Batch APIGeprüft am 2026-07-14
- OpenAI Batch API referenceGeprüft am 2026-07-14
- TokenLab model rankingsGeprüft am 2026-07-14



