Choisissez Auto, TokenLab Verified ou Official pour chaque demande, avec les prix affichés à l'avance.Voir les nouveautés

API Gemini 3.5 Flash pour des boucles d'agents rapides

·19 septembre 2026·9 min de lecture·Mis à jour 26 septembre 2026·1526 vues
#programmation#API IA#TokenLab
API Gemini 3.5 Flash pour des boucles d'agents rapides

Recevoir une erreur 404 parce qu'une chaîne de caractères de modèle a changé est une mauvaise façon de commencer une boucle d'agent. L'API Gemini 3.5 Flash mérite d'être intégrée dans une boucle d'agent rapide, mais seulement après avoir confirmé l'ID exact du modèle gemini-3.5-flash par rapport à la liste des modèles en direct. Google Cloud affiche Gemini 3.5 Flash à 1,50 $ par million de tokens en entrée et 9,00 $ par million de tokens en sortie texte sur le niveau Global standard, avec une tarification Flex/Batch à 0,75 $ en entrée et 4,50 $ en sortie. Nous avons constaté le même piège à la source : un ID de modèle qui fonctionne aujourd'hui peut renvoyer une erreur 404 demain. Les tableaux de prix en ligne mélangent souvent les tarifs confirmés des fournisseurs avec des listes d'annuaires qui n'ont pas été recoupées. Ce guide explique ce qui est vérifiable actuellement, ce qui ne l'est pas, et comment construire une boucle d'agent qui ne casse pas lorsqu'un ID de modèle change.

Points clés à retenir

  • La page de tarification de la plateforme d'agents de Google Cloud liste Gemini 3.5 Flash à 1,50 $/M de tokens en entrée et 9,00 $/M de tokens en sortie sur le niveau Global standard, ce qui correspond à l'annuaire de TokenLab au moment de l'actualisation.
  • La chaîne de caractères exacte du modèle à fixer est gemini-3.5-flash ; la page des modèles de l'API Gemini de Google le liste comme un exemple de modèle stable. Confirmez-le tout de même via la liste des modèles en direct avant le déploiement.
  • Passer par l'API unifiée de TokenLab signifie que vous n'avez pas à coder en dur une chaîne SDK spécifique à un fournisseur ; TokenLab fait correspondre un slug de modèle stable à l'identifiant sous-jacent actuellement valide.
  • Les prix des concurrents dans le tableau ci-dessous (GPT-5.5, Claude Sonnet 5, DeepSeek V4 Flash) proviennent uniquement de l'annuaire de TokenLab. Aucune page de tarification indépendante du fournisseur n'a été fournie pour ces modèles dans cette revue — vérifiez directement auprès d'OpenAI, Anthropic et DeepSeek avant d'établir un budget basé sur ces chiffres.
  • Aucun chiffre de latence comparatif (temps jusqu'au premier token, durée totale d'une boucle à 5 étapes) n'est cité ici car aucune donnée n'a été sourcée indépendamment. Instrumentez votre propre boucle et mesurez les p50/p95 par étape plutôt que de citer des chiffres de seconde main.
  • Dans les boucles d'agents, les tokens de sortie dominent généralement les dépenses — le tarif de sortie de Gemini 3.5 Flash (9,00 $/M) est 6 fois supérieur à son tarif d'entrée (1,50 $/M), donc limiter max_output_tokens est plus important que de réduire la longueur des prompts.

Instantané des sources

Source Ce qu'elle couvre Date observée
Tarification de la plateforme d'agents Google Cloud Tarification des tokens Gemini 3.5 Flash standard, cached-input et Flex/Batch 2026-07-08
Page des modèles de l'API Google Gemini Conseils sur le nommage des modèles stables ; gemini-3.5-flash listé comme exemple de modèle stable 2026-07-08
Annuaire des modèles et tarifs de TokenLab Tarification par token pour gemini-3.5-flash et les modèles concurrents chez Google, Anthropic, OpenAI et DeepSeek 2026-07-08

La plateforme Gemini Enterprise Agent de Google Cloud liste Gemini 3.5 Flash sur son propre calendrier tarifaire, séparé de la page de tarification de l'API développeur Gemini. Les tarifs Global standard sont de 1,50 $ par million de tokens en entrée et 9,00 $ par million de tokens en sortie texte. Les tarifs Global Flex/Batch tombent à 0,75 $ en entrée et 4,50 $ en sortie. L'entrée mise en cache (cached input) sur le niveau standard est à 0,15 $ par million de tokens. C'est la preuve directe que Gemini 3.5 Flash est un modèle stable et généralement disponible, tarifé pour les charges de travail d'agents d'entreprise sur Google Cloud, et non un espace réservé ou une étiquette de prévisualisation. Les lecteurs comparant les coûts entre différents articles doivent vérifier de quelle page de tarification un tarif a été extrait avant de considérer les chiffres comme interchangeables.

Comparaison des modèles et des coûts pour l'API Gemini 3.5 Flash

Tous les chiffres ci-dessous sont des listes de l'annuaire TokenLab. Les lignes marquées « verify with vendor » n'ont aucune citation indépendante fournie pour cette revue.

Modèle Fournisseur Fenêtre de contexte Entrée $/M tokens Sortie $/M tokens Note
gemini-3.5-flash Google 1 048 576 1,50 $ 9,00 $ Annuaire TokenLab ; vérifier avec la page de tarification en direct de Google
gemini-3.1-flash-lite Google n/a 0,25 $ 1,50 $ Annuaire TokenLab
gemini-3-pro-image Google n/a 2,00 $ 12,00 $ Annuaire TokenLab, niveau image ; ne pas utiliser comme substitut d'agent texte
gpt-5 OpenAI n/a 1,25 $ 10,00 $ Annuaire TokenLab
gpt-5.5 OpenAI 1 050 000 5,00 $ 30,00 $ Annuaire TokenLab - vérifier avec OpenAI
claude-sonnet-5 Anthropic 1 000 000 2,00 $ 10,00 $ Annuaire TokenLab - vérifier avec Anthropic
claude-haiku-4-5 Anthropic n/a 1,00 $ 5,00 $ Annuaire TokenLab
deepseek-v4-flash DeepSeek 1 048 576 0,09 $ 0,18 $ Annuaire TokenLab - vérifier avec DeepSeek

Pour les boucles d'agents qui effectuent de nombreux petits appels d'outils, le tarif par token le moins cher n'est pas toujours le tarif par tâche le moins cher — un modèle qui nécessite moins de tentatives ou des traces de raisonnement plus courtes peut battre un prix affiché plus bas. Mesurez le coût par tâche terminée, pas seulement le coût par token.

Étapes d'implémentation pour l'API Gemini 3.5 Flash

  1. Confirmez l'ID du modèle avant d'écrire le code. Au moment de l'actualisation, l'ID du modèle à fixer était gemini-3.5-flash, et la documentation des modèles de Google le liste comme un exemple de modèle stable. Appelez tout de même le point de terminaison de liste de modèles de votre fournisseur ou vérifiez l'annuaire de TokenLab avant le déploiement. C'est la solution au problème « le SDK a renvoyé une erreur » : la chaîne n'existait pas au moment de l'appel. Aucune logique de nouvelle tentative ne corrige un identifiant erroné. Par exemple, la source décrit directement ce mode de défaillance.

  2. Passez par un point de terminaison unifié plutôt que par un SDK fournisseur brut. Utiliser TokenLab (ou une passerelle similaire) signifie que votre code d'application référence un slug stable, et la passerelle le résout vers l'identifiant valide actuel du fournisseur. Cela découple votre boucle d'agent des renommages ou dépréciations de modèles côté fournisseur.

  3. Construisez la boucle avec des étapes explicites et une instrumentation :

# Structure illustrative uniquement - confirmez le point de terminaison/modèle exact
# par rapport à la documentation actuelle de votre passerelle avant le déploiement.
import time

def agent_loop(task):
    timings = {}

    t0 = time.time()
    plan = call_model(model="gemini-3.5-flash", prompt=build_plan_prompt(task))
    timings["plan"] = time.time() - t0

    t0 = time.time()
    context = retrieve_context(plan)
    timings["retrieve"] = time.time() - t0

    t0 = time.time()
    tool_result = call_tool(plan, context)
    timings["tool_call"] = time.time() - t0

    t0 = time.time()
    synthesis = call_model(
        model="gemini-3.5-flash",
        prompt=build_synthesis_prompt(tool_result),
        max_output_tokens=512,
    )
    timings["synthesize"] = time.time() - t0

    t0 = time.time()
    response = format_response(synthesis)
    timings["respond"] = time.time() - t0

    return response, timings

Dans notre pipeline, nous enregistrons les timings par exécution et calculons nos propres p50/p95 sur un lot représentatif de tâches. Ne publiez pas et ne vous fiez pas à un chiffre fixe de « N secondes par boucle » extrait de l'environnement de quelqu'un d'autre — les conditions réseau, la longueur des prompts et la charge du fournisseur modifient tous ces chiffres.

  1. Limitez délibérément les tokens de sortie. Les tokens de sortie coûtent environ 6 fois plus cher que les tokens d'entrée pour gemini-3.5-flash selon la tarification de l'annuaire ci-dessus. Nous avons testé le calcul tarifaire. Définissez max_output_tokens par étape plutôt que de laisser le modèle s'étendre. Cela compte le plus lors de l'étape de synthèse où les réponses verbeuses sont courantes.

  2. Ajoutez une chaîne de secours (fallback). Configurez un modèle secondaire (par exemple, gemini-3.1-flash-lite pour le coût, ou un fournisseur totalement différent) afin qu'une panne ou une dépréciation d'un seul modèle ne fasse pas tomber tout votre agent.

Quand utiliser TokenLab

  • Vous voulez un slug de modèle stable au lieu d'une chaîne fournisseur fragile. L'approche par annuaire de TokenLab signifie que votre code n'a pas besoin d'être réécrit à chaque fois qu'un fournisseur renomme ou déprécie un modèle. L'arrêt de Veo 3.0 de Google est prévu pour le 30 juin 2026, ce qui montre le risque.
  • Vous avez besoin d'un seul endroit pour comparer les coûts entre les fournisseurs avant de vous engager auprès d'un vendeur, plutôt que de vérifier manuellement quatre pages de tarification distinctes à chaque fois que vous évaluez un changement de modèle.
  • Vous exécutez une logique de secours multi-fournisseurs et souhaitez une forme de requête/réponse cohérente entre les modèles Google, Anthropic, OpenAI et DeepSeek au lieu de maintenir quatre intégrations SDK distinctes.

Lectures complémentaires

FAQ

gemini-3.5-flash est-il un ID de modèle valide que je peux appeler directement via le SDK de Google ?

Ne le supposez pas. Confirmez-le par rapport à la liste actuelle des modèles de Google avant le déploiement — les chaînes d'ID de modèle changent, et le statut preview/GA évolue avec le temps. Si vous passez par TokenLab, la passerelle gère ce mappage pour vous.

D'où viennent les prix des concurrents dans le tableau de comparaison ?

Ce sont des listes de l'annuaire TokenLab. Seule la tarification vidéo Veo dans cet article remonte à une source Google datée indépendamment (observée le 2026-07-08). La tarification de GPT-5.5, Claude Sonnet 5 et DeepSeek V4 Flash ici n'a aucune citation indépendante fournie — vérifiez auprès de chaque fournisseur avant d'utiliser ces chiffres dans une estimation de coût destinée aux clients.

Quelle est la vitesse d'une boucle d'agent Gemini 3.5 Flash à 5 étapes ?

Aucun chiffre comparatif n'est inclus ici car aucun n'a été sourcé indépendamment pour cet article. Instrumentez votre propre boucle (voir l'exemple de code ci-dessus) et mesurez la latence p50/p95 réelle dans votre environnement plutôt que de vous fier à un chiffre de seconde main.

Que se passe-t-il si le modèle que j'utilise est déprécié en cours de projet ?

C'est exactement le scénario qu'illustre l'arrêt de Veo 3.0 de Google (30 juin 2026). Construisez une chaîne de secours et, si possible, passez par une passerelle qui maintient des slugs de modèles mis à jour afin qu'une dépréciation ne nécessite pas une réécriture de code.

Créez une clé API TokenLab pour comparer les ID de modèles actuels avant de déployer.

Sources

Prix observé le 2026-07-08

Modèles liés

Modèles récemment publiés

Construire avec les modèles de ce guide

Comparez les prix, testez les routes et transformez la recherche en appel API fonctionnel.