Wählen Sie Auto, TokenLab Verified oder Official für jede Anfrage, wobei die Preise vorab angezeigt werden.Neuigkeiten ansehen

Gemini 3.5 Flash API für schnelle Agent-Loops

·19. September 2026·8 Min. Lesezeit·Aktualisiert 26. September 2026·1505 Aufrufe
#Programmierung#KI API#TokenLab
Gemini 3.5 Flash API für schnelle Agent-Loops

Ein 404-Fehler, weil ein Modell-String verschoben wurde, ist ein schlechter Start für einen Agent-Loop. Die Gemini 3.5 Flash API ist es wert, in einen schnellen Agent-Loop eingebunden zu werden, aber erst nachdem Sie die exakte gemini-3.5-flash Modell-ID anhand der aktuellen Modellliste überprüft haben. Google Cloud listet Gemini 3.5 Flash mit 1,50 $ pro 1 Mio. Input-Tokens und 9,00 $ pro 1 Mio. Text-Output-Tokens im Standard Global-Tarif; Flex/Batch-Preise liegen bei 0,75 $ für Input und 4,50 $ für Output. Wir haben dieselbe Falle in der Quelle gesehen: Eine Modell-ID, die heute funktioniert, kann morgen einen 404-Fehler auslösen. Preistabellen im Internet vermischen oft bestätigte Anbieterpreise mit Verzeichniseinträgen, die nicht gegengeprüft wurden. Dieser Leitfaden behandelt, was derzeit verifizierbar ist, was nicht und wie man einen Agent-Loop baut, der nicht abbricht, wenn sich eine Modell-ID ändert.

Wichtige Erkenntnisse

  • Die Preisübersichtsseite der Google Cloud Agent Platform listet Gemini 3.5 Flash mit 1,50 $/M Input-Tokens und 9,00 $/M Output-Tokens im Standard Global-Tarif, was zum Zeitpunkt der Aktualisierung dem Verzeichniseintrag von TokenLab entspricht.
  • Der exakte Modell-String, der fixiert werden sollte, ist gemini-3.5-flash; die Seite für Gemini API-Modelle von Google führt ihn als Beispiel für ein stabiles Modell auf. Überprüfen Sie ihn dennoch vor dem Deployment über die Live-Modellliste.
  • Das Routing über die vereinheitlichte API von TokenLab bedeutet, dass Sie keinen anbieterspezifischen SDK-String hartcodieren müssen; TokenLab ordnet einen stabilen Modell-Slug dem jeweils gültigen zugrunde liegenden Identifikator zu.
  • Die Preise der Wettbewerber in der Tabelle unten (GPT-5.5, Claude Sonnet 5, DeepSeek V4 Flash) stammen ausschließlich aus dem Verzeichnis von TokenLab. Für diese Modelle wurde in diesem Bericht keine unabhängige Preisliste des Anbieters bereitgestellt – prüfen Sie dies direkt bei OpenAI, Anthropic und DeepSeek, bevor Sie Budgets auf Basis dieser Zahlen planen.
  • Es werden hier keine gemessenen Latenzwerte (Time-to-First-Token, Dauer eines vollständigen 5-Schritte-Loops) zitiert, da keine unabhängig erhoben wurden. Instrumentieren Sie Ihren eigenen Loop und messen Sie p50/p95 pro Schritt, anstatt Zahlen aus zweiter Hand zu zitieren.
  • In Agent-Loops dominieren typischerweise die Output-Tokens die Kosten – die Output-Rate von Gemini 3.5 Flash (9,00 $/M) ist 6-mal so hoch wie die Input-Rate (1,50 $/M), daher ist die Begrenzung von max_output_tokens wichtiger als das Kürzen der Prompt-Länge.

Quellen-Snapshot

Quelle Inhalt Beobachtungsdatum
Google Cloud Agent Platform Preise Gemini 3.5 Flash Standard, Cached-Input und Flex/Batch Token-Preise 08.07.2026
Google Gemini API Modellseite Leitfaden zur stabilen Modellbenennung; gemini-3.5-flash als Beispiel für ein stabiles Modell gelistet 08.07.2026
TokenLab Modell- & Preisverzeichnis Token-Preise für gemini-3.5-flash und Wettbewerbermodelle über Google, Anthropic, OpenAI und DeepSeek 08.07.2026

Die Gemini Enterprise Agent Platform von Google Cloud listet Gemini 3.5 Flash in einem eigenen Preisplan, getrennt von der Preisübersichtsseite der Gemini Developer API. Die Standard Global-Raten betragen 1,50 $ pro 1 Mio. Input-Tokens und 9,00 $ pro 1 Mio. Text-Output-Tokens. Die Flex/Batch Global-Raten sinken auf 0,75 $ für Input und 4,50 $ für Output. Cached Input im Standard-Tarif kostet 0,15 $ pro 1 Mio. Tokens. Dies ist ein direkter Beleg dafür, dass Gemini 3.5 Flash ein stabiles, allgemein verfügbares Modell ist, das für Enterprise-Agent-Workloads auf Google Cloud bepreist ist, und kein Platzhalter oder Preview-Label. Leser, die Kosten über verschiedene Artikel hinweg vergleichen, sollten prüfen, von welcher Preisliste ein Satz stammt, bevor sie die Zahlen als austauschbar betrachten.

Modell- und Kostenvergleich für die Gemini 3.5 Flash API

Alle unten aufgeführten Zahlen sind TokenLab-Verzeichniseinträge. Zeilen, die mit 'verify with vendor' markiert sind, haben für diesen Bericht keine unabhängige Quellenangabe.

Modell Anbieter Kontextfenster Input $/M Tokens Output $/M Tokens Hinweis
gemini-3.5-flash Google 1.048.576 1,50 $ 9,00 $ TokenLab-Verzeichnis; mit Googles Live-Preisliste abgleichen
gemini-3.1-flash-lite Google n/a 0,25 $ 1,50 $ TokenLab-Verzeichnis
gemini-3-pro-image Google n/a 2,00 $ 12,00 $ TokenLab-Verzeichnis, Image-Tarif; nicht als Text-Agent-Ersatz verwenden
gpt-5 OpenAI n/a 1,25 $ 10,00 $ TokenLab-Verzeichnis
gpt-5.5 OpenAI 1.050.000 5,00 $ 30,00 $ TokenLab-Verzeichnis – bei OpenAI verifizieren
claude-sonnet-5 Anthropic 1.000.000 2,00 $ 10,00 $ TokenLab-Verzeichnis – bei Anthropic verifizieren
claude-haiku-4-5 Anthropic n/a 1,00 $ 5,00 $ TokenLab-Verzeichnis
deepseek-v4-flash DeepSeek 1.048.576 0,09 $ 0,18 $ TokenLab-Verzeichnis – bei DeepSeek verifizieren

Für Agent-Loops, die viele kleine Tool-Calling-Schritte ausführen, ist die günstigste Rate pro Token nicht immer die günstigste Rate pro Aufgabe – ein Modell, das weniger Wiederholungen oder kürzere Reasoning-Traces benötigt, kann einen niedrigeren Listenpreis schlagen. Messen Sie die Kosten pro abgeschlossener Aufgabe, nicht nur die Kosten pro Token.

Implementierungsschritte für die Gemini 3.5 Flash API

  1. Bestätigen Sie die Modell-ID, bevor Sie Code schreiben. Zum Zeitpunkt der Aktualisierung war die zu fixierende Modell-ID gemini-3.5-flash, und die Model-Docs von Google führen sie als Beispiel für ein stabiles Modell auf. Rufen Sie dennoch den Modell-Listen-Endpunkt Ihres Anbieters auf oder prüfen Sie das Verzeichnis von TokenLab vor dem Deployment. Dies ist die Lösung für das Problem "SDK hat einen Fehler geworfen": Der String existierte zum Zeitpunkt des Aufrufs nicht. Keine Retry-Logik der Welt behebt einen falschen Identifikator. Die Quelle beschreibt beispielsweise diesen Fehlermodus direkt.

  2. Routen Sie über einen vereinheitlichten Endpunkt anstatt über ein rohes Anbieter-SDK. Die Verwendung von TokenLab (oder einem ähnlichen Gateway) bedeutet, dass Ihr Anwendungscode auf einen stabilen Slug verweist und das Gateway diesen in den aktuell gültigen Identifikator des Anbieters auflöst. Dies entkoppelt Ihren Agent-Loop von Umbenennungen oder Deprecations seitens des Anbieters.

  3. Bauen Sie den Loop mit expliziten Schritten und Instrumentierung:

# Nur illustrative Struktur – bestätigen Sie den exakten Endpunkt/Modell-
# Felder anhand der aktuellen Dokumentation Ihres Gateways vor dem Deployment.
import time

def agent_loop(task):
    timings = {}

    t0 = time.time()
    plan = call_model(model="gemini-3.5-flash", prompt=build_plan_prompt(task))
    timings["plan"] = time.time() - t0

    t0 = time.time()
    context = retrieve_context(plan)
    timings["retrieve"] = time.time() - t0

    t0 = time.time()
    tool_result = call_tool(plan, context)
    timings["tool_call"] = time.time() - t0

    t0 = time.time()
    synthesis = call_model(
        model="gemini-3.5-flash",
        prompt=build_synthesis_prompt(tool_result),
        max_output_tokens=512,
    )
    timings["synthesize"] = time.time() - t0

    t0 = time.time()
    response = format_response(synthesis)
    timings["respond"] = time.time() - t0

    return response, timings

In unserer Pipeline protokollieren wir timings pro Durchlauf und berechnen unsere eigenen p50/p95-Werte über eine repräsentative Charge von Aufgaben. Veröffentlichen oder verlassen Sie sich nicht auf eine feste Zahl von "N Sekunden pro Loop", die aus der Umgebung einer anderen Person stammt – Netzwerkbedingungen, Prompt-Länge und Anbieterauslastung verändern diese Zahlen ständig.

  1. Begrenzen Sie Output-Tokens bewusst. Output-Tokens kosten für gemini-3.5-flash laut der obigen Verzeichnispreisliste etwa 6-mal so viel wie Input-Tokens. Wir haben die Preismathematik getestet. Setzen Sie max_output_tokens pro Schritt, anstatt das Modell lange laufen zu lassen. Dies ist besonders wichtig beim Synthese-Schritt, bei dem ausführliche Antworten üblich sind.

  2. Fügen Sie eine Fallback-Kette hinzu. Konfigurieren Sie ein sekundäres Modell (z. B. gemini-3.1-flash-lite aus Kostengründen oder einen ganz anderen Anbieter), damit ein einzelner Modellausfall oder eine Deprecation nicht Ihren gesamten Agenten lahmlegt.

Wann Sie TokenLab verwenden sollten

  • Sie möchten einen stabilen Modell-Slug anstelle eines spröden Anbieter-Strings. Der Verzeichnisansatz von TokenLab bedeutet, dass Ihr Code nicht jedes Mal neu geschrieben werden muss, wenn ein Anbieter ein Modell umbenennt oder für veraltet erklärt. Die Abschaltung von Googles eigenem Veo 3.0 ist für den 30. Juni 2026 geplant, was das Risiko verdeutlicht.
  • Sie benötigen einen zentralen Ort, um Kosten über Anbieter hinweg zu vergleichen, bevor Sie sich auf einen Anbieter festlegen, anstatt jedes Mal manuell vier separate Preislisten zu prüfen, wenn Sie einen Modellwechsel evaluieren.
  • Sie führen eine Multi-Provider-Fallback-Logik aus und möchten eine konsistente Request/Response-Form über Google-, Anthropic-, OpenAI- und DeepSeek-Modelle hinweg, anstatt vier separate SDK-Integrationen zu pflegen.

Weiterführende Literatur

FAQ

Ist gemini-3.5-flash eine gültige Modell-ID, die ich direkt über das Google-SDK aufrufen kann?

Gehen Sie nicht davon aus. Überprüfen Sie dies vor dem Deployment anhand der aktuellen Modellliste von Google – Modell-ID-Strings ändern sich, und der Preview/GA-Status verschiebt sich im Laufe der Zeit. Wenn Sie über TokenLab routen, übernimmt das Gateway dieses Mapping für Sie.

Woher stammen die Wettbewerberpreise in der Vergleichstabelle?

Es handelt sich um TokenLab-Verzeichniseinträge. Nur die Veo-Videopreise in diesem Artikel lassen sich auf eine unabhängig datierte Google-Quelle zurückführen (beobachtet am 08.07.2026). Für die Preise von GPT-5.5, Claude Sonnet 5 und DeepSeek V4 Flash wurde hier keine unabhängige Quellenangabe bereitgestellt – prüfen Sie dies bei jedem Anbieter, bevor Sie diese Zahlen in einer kundenorientierten Kostenschätzung verwenden.

Wie schnell ist ein 5-Schritte-Gemini 3.5 Flash Agent-Loop?

Hier ist kein gemessener Wert enthalten, da für diesen Artikel keiner unabhängig erhoben wurde. Instrumentieren Sie Ihren eigenen Loop (siehe Code-Beispiel oben) und messen Sie die tatsächliche p50/p95-Latenz in Ihrer Umgebung, anstatt sich auf eine Zahl aus zweiter Hand zu verlassen.

Was passiert, wenn das Modell, das ich verwende, mitten im Projekt für veraltet erklärt wird?

Dies ist genau das Szenario, das die Abschaltung von Googles Veo 3.0 (30. Juni 2026) illustriert. Bauen Sie eine Fallback-Kette auf und routen Sie nach Möglichkeit über ein Gateway, das aktualisierte Modell-Slugs pflegt, damit eine Deprecation kein Umschreiben des Codes erfordert.

Erstellen Sie einen TokenLab API-Key, um aktuelle Modell-IDs zu vergleichen, bevor Sie deployen.

Quellen

Preis geprüft am 2026-07-08

Verwandte Modelle

Kürzlich veröffentlichte Modelle

Mit den Modellen aus diesem Leitfaden bauen

Preise vergleichen, Routen testen und aus der Recherche einen laufenden API-Aufruf machen.