Recevoir une erreur 404 parce qu'une chaîne de caractères de modèle a changé est une mauvaise façon de commencer une boucle d'agent. L'API Gemini 3.5 Flash mérite d'être intégrée dans une boucle d'agent rapide, mais seulement après avoir confirmé l'ID exact du modèle gemini-3.5-flash par rapport à la liste des modèles en direct. Google Cloud affiche Gemini 3.5 Flash à 1,50 $ par million de tokens en entrée et 9,00 $ par million de tokens en sortie texte sur le niveau Global standard, avec une tarification Flex/Batch à 0,75 $ en entrée et 4,50 $ en sortie. Nous avons constaté le même piège à la source : un ID de modèle qui fonctionne aujourd'hui peut renvoyer une erreur 404 demain. Les tableaux de prix en ligne mélangent souvent les tarifs confirmés des fournisseurs avec des listes d'annuaires qui n'ont pas été recoupées. Ce guide explique ce qui est vérifiable actuellement, ce qui ne l'est pas, et comment construire une boucle d'agent qui ne casse pas lorsqu'un ID de modèle change.
Points clés à retenir
- La page de tarification de la plateforme d'agents de Google Cloud liste Gemini 3.5 Flash à 1,50 $/M de tokens en entrée et 9,00 $/M de tokens en sortie sur le niveau Global standard, ce qui correspond à l'annuaire de TokenLab au moment de l'actualisation.
- La chaîne de caractères exacte du modèle à fixer est
gemini-3.5-flash; la page des modèles de l'API Gemini de Google le liste comme un exemple de modèle stable. Confirmez-le tout de même via la liste des modèles en direct avant le déploiement. - Passer par l'API unifiée de TokenLab signifie que vous n'avez pas à coder en dur une chaîne SDK spécifique à un fournisseur ; TokenLab fait correspondre un slug de modèle stable à l'identifiant sous-jacent actuellement valide.
- Les prix des concurrents dans le tableau ci-dessous (GPT-5.5, Claude Sonnet 5, DeepSeek V4 Flash) proviennent uniquement de l'annuaire de TokenLab. Aucune page de tarification indépendante du fournisseur n'a été fournie pour ces modèles dans cette revue — vérifiez directement auprès d'OpenAI, Anthropic et DeepSeek avant d'établir un budget basé sur ces chiffres.
- Aucun chiffre de latence comparatif (temps jusqu'au premier token, durée totale d'une boucle à 5 étapes) n'est cité ici car aucune donnée n'a été sourcée indépendamment. Instrumentez votre propre boucle et mesurez les p50/p95 par étape plutôt que de citer des chiffres de seconde main.
- Dans les boucles d'agents, les tokens de sortie dominent généralement les dépenses — le tarif de sortie de Gemini 3.5 Flash (9,00 $/M) est 6 fois supérieur à son tarif d'entrée (1,50 $/M), donc limiter
max_output_tokensest plus important que de réduire la longueur des prompts.
Instantané des sources
| Source | Ce qu'elle couvre | Date observée |
|---|---|---|
| Tarification de la plateforme d'agents Google Cloud | Tarification des tokens Gemini 3.5 Flash standard, cached-input et Flex/Batch | 2026-07-08 |
| Page des modèles de l'API Google Gemini | Conseils sur le nommage des modèles stables ; gemini-3.5-flash listé comme exemple de modèle stable |
2026-07-08 |
| Annuaire des modèles et tarifs de TokenLab | Tarification par token pour gemini-3.5-flash et les modèles concurrents chez Google, Anthropic, OpenAI et DeepSeek |
2026-07-08 |
La plateforme Gemini Enterprise Agent de Google Cloud liste Gemini 3.5 Flash sur son propre calendrier tarifaire, séparé de la page de tarification de l'API développeur Gemini. Les tarifs Global standard sont de 1,50 $ par million de tokens en entrée et 9,00 $ par million de tokens en sortie texte. Les tarifs Global Flex/Batch tombent à 0,75 $ en entrée et 4,50 $ en sortie. L'entrée mise en cache (cached input) sur le niveau standard est à 0,15 $ par million de tokens. C'est la preuve directe que Gemini 3.5 Flash est un modèle stable et généralement disponible, tarifé pour les charges de travail d'agents d'entreprise sur Google Cloud, et non un espace réservé ou une étiquette de prévisualisation. Les lecteurs comparant les coûts entre différents articles doivent vérifier de quelle page de tarification un tarif a été extrait avant de considérer les chiffres comme interchangeables.
Comparaison des modèles et des coûts pour l'API Gemini 3.5 Flash
Tous les chiffres ci-dessous sont des listes de l'annuaire TokenLab. Les lignes marquées « verify with vendor » n'ont aucune citation indépendante fournie pour cette revue.
| Modèle | Fournisseur | Fenêtre de contexte | Entrée $/M tokens | Sortie $/M tokens | Note |
|---|---|---|---|---|---|
| gemini-3.5-flash | 1 048 576 | 1,50 $ | 9,00 $ | Annuaire TokenLab ; vérifier avec la page de tarification en direct de Google | |
| gemini-3.1-flash-lite | n/a | 0,25 $ | 1,50 $ | Annuaire TokenLab | |
| gemini-3-pro-image | n/a | 2,00 $ | 12,00 $ | Annuaire TokenLab, niveau image ; ne pas utiliser comme substitut d'agent texte | |
| gpt-5 | OpenAI | n/a | 1,25 $ | 10,00 $ | Annuaire TokenLab |
| gpt-5.5 | OpenAI | 1 050 000 | 5,00 $ | 30,00 $ | Annuaire TokenLab - vérifier avec OpenAI |
| claude-sonnet-5 | Anthropic | 1 000 000 | 2,00 $ | 10,00 $ | Annuaire TokenLab - vérifier avec Anthropic |
| claude-haiku-4-5 | Anthropic | n/a | 1,00 $ | 5,00 $ | Annuaire TokenLab |
| deepseek-v4-flash | DeepSeek | 1 048 576 | 0,09 $ | 0,18 $ | Annuaire TokenLab - vérifier avec DeepSeek |
Pour les boucles d'agents qui effectuent de nombreux petits appels d'outils, le tarif par token le moins cher n'est pas toujours le tarif par tâche le moins cher — un modèle qui nécessite moins de tentatives ou des traces de raisonnement plus courtes peut battre un prix affiché plus bas. Mesurez le coût par tâche terminée, pas seulement le coût par token.
Étapes d'implémentation pour l'API Gemini 3.5 Flash
Confirmez l'ID du modèle avant d'écrire le code. Au moment de l'actualisation, l'ID du modèle à fixer était
gemini-3.5-flash, et la documentation des modèles de Google le liste comme un exemple de modèle stable. Appelez tout de même le point de terminaison de liste de modèles de votre fournisseur ou vérifiez l'annuaire de TokenLab avant le déploiement. C'est la solution au problème « le SDK a renvoyé une erreur » : la chaîne n'existait pas au moment de l'appel. Aucune logique de nouvelle tentative ne corrige un identifiant erroné. Par exemple, la source décrit directement ce mode de défaillance.Passez par un point de terminaison unifié plutôt que par un SDK fournisseur brut. Utiliser TokenLab (ou une passerelle similaire) signifie que votre code d'application référence un slug stable, et la passerelle le résout vers l'identifiant valide actuel du fournisseur. Cela découple votre boucle d'agent des renommages ou dépréciations de modèles côté fournisseur.
Construisez la boucle avec des étapes explicites et une instrumentation :
# Structure illustrative uniquement - confirmez le point de terminaison/modèle exact
# par rapport à la documentation actuelle de votre passerelle avant le déploiement.
import time
def agent_loop(task):
timings = {}
t0 = time.time()
plan = call_model(model="gemini-3.5-flash", prompt=build_plan_prompt(task))
timings["plan"] = time.time() - t0
t0 = time.time()
context = retrieve_context(plan)
timings["retrieve"] = time.time() - t0
t0 = time.time()
tool_result = call_tool(plan, context)
timings["tool_call"] = time.time() - t0
t0 = time.time()
synthesis = call_model(
model="gemini-3.5-flash",
prompt=build_synthesis_prompt(tool_result),
max_output_tokens=512,
)
timings["synthesize"] = time.time() - t0
t0 = time.time()
response = format_response(synthesis)
timings["respond"] = time.time() - t0
return response, timings
Dans notre pipeline, nous enregistrons les timings par exécution et calculons nos propres p50/p95 sur un lot représentatif de tâches. Ne publiez pas et ne vous fiez pas à un chiffre fixe de « N secondes par boucle » extrait de l'environnement de quelqu'un d'autre — les conditions réseau, la longueur des prompts et la charge du fournisseur modifient tous ces chiffres.
Limitez délibérément les tokens de sortie. Les tokens de sortie coûtent environ 6 fois plus cher que les tokens d'entrée pour
gemini-3.5-flashselon la tarification de l'annuaire ci-dessus. Nous avons testé le calcul tarifaire. Définissezmax_output_tokenspar étape plutôt que de laisser le modèle s'étendre. Cela compte le plus lors de l'étape de synthèse où les réponses verbeuses sont courantes.Ajoutez une chaîne de secours (fallback). Configurez un modèle secondaire (par exemple,
gemini-3.1-flash-litepour le coût, ou un fournisseur totalement différent) afin qu'une panne ou une dépréciation d'un seul modèle ne fasse pas tomber tout votre agent.
Quand utiliser TokenLab
- Vous voulez un slug de modèle stable au lieu d'une chaîne fournisseur fragile. L'approche par annuaire de TokenLab signifie que votre code n'a pas besoin d'être réécrit à chaque fois qu'un fournisseur renomme ou déprécie un modèle. L'arrêt de Veo 3.0 de Google est prévu pour le 30 juin 2026, ce qui montre le risque.
- Vous avez besoin d'un seul endroit pour comparer les coûts entre les fournisseurs avant de vous engager auprès d'un vendeur, plutôt que de vérifier manuellement quatre pages de tarification distinctes à chaque fois que vous évaluez un changement de modèle.
- Vous exécutez une logique de secours multi-fournisseurs et souhaitez une forme de requête/réponse cohérente entre les modèles Google, Anthropic, OpenAI et DeepSeek au lieu de maintenir quatre intégrations SDK distinctes.
Lectures complémentaires
FAQ
gemini-3.5-flash est-il un ID de modèle valide que je peux appeler directement via le SDK de Google ?
Ne le supposez pas. Confirmez-le par rapport à la liste actuelle des modèles de Google avant le déploiement — les chaînes d'ID de modèle changent, et le statut preview/GA évolue avec le temps. Si vous passez par TokenLab, la passerelle gère ce mappage pour vous.
D'où viennent les prix des concurrents dans le tableau de comparaison ?
Ce sont des listes de l'annuaire TokenLab. Seule la tarification vidéo Veo dans cet article remonte à une source Google datée indépendamment (observée le 2026-07-08). La tarification de GPT-5.5, Claude Sonnet 5 et DeepSeek V4 Flash ici n'a aucune citation indépendante fournie — vérifiez auprès de chaque fournisseur avant d'utiliser ces chiffres dans une estimation de coût destinée aux clients.
Quelle est la vitesse d'une boucle d'agent Gemini 3.5 Flash à 5 étapes ?
Aucun chiffre comparatif n'est inclus ici car aucun n'a été sourcé indépendamment pour cet article. Instrumentez votre propre boucle (voir l'exemple de code ci-dessus) et mesurez la latence p50/p95 réelle dans votre environnement plutôt que de vous fier à un chiffre de seconde main.
Que se passe-t-il si le modèle que j'utilise est déprécié en cours de projet ?
C'est exactement le scénario qu'illustre l'arrêt de Veo 3.0 de Google (30 juin 2026). Construisez une chaîne de secours et, si possible, passez par une passerelle qui maintient des slugs de modèles mis à jour afin qu'une dépréciation ne nécessite pas une réécriture de code.
Créez une clé API TokenLab pour comparer les ID de modèles actuels avant de déployer.
Sources
Prix observé le 2026-07-08
- Google AI Gemini API pricingObservé le 2026-07-08
- Google Cloud Agent Platform pricingObservé le 2026-07-08
- Google Gemini API modelsObservé le 2026-07-08
- TokenLab model directoryObservé le 2026-07-07



