Dans notre pipeline d'agents, le modèle le moins cher par token est rarement le modèle le moins cher par tâche accomplie. Lorsque nous avons testé les meilleurs modèles d'IA économiques pour les agents, les tokens de sortie générés par les appels d'outils, la réparation JSON et la chaîne de pensée (chain-of-thought) ont dominé les dépenses. DeepSeek V4 Flash, Gemini 3.5 Flash, Claude Sonnet 5, GPT-5.5, GLM-5.2 et Laguna XS 2.1 sont les exemples actuels de SSOT (Source unique de vérité) dont nous pouvons discuter. Les prix du catalogue TokenLab ci-dessous ont été observés le 19/09/2026 ; les prix externes ne sont pas datés et nécessitent une confirmation du fournisseur. Nous ne publions pas de benchmark de latence car aucun jeu de données contrôlé sur le TTFT, les tokens/sec ou le taux de réessai n'était disponible pour ces routes exactes au moment de l'actualisation. Considérez ceci comme une liste restreinte basée sur les coûts et les modes de défaillance, puis évaluez la latence dans votre propre boucle.
Points clés à retenir
- Le coût de sortie pèse plus lourd dans les dépenses des agents que le coût d'entrée. Les agents génèrent beaucoup plus de tokens via les appels d'outils, les réessais et le JSON qu'ils n'en consomment par tour.
- Parmi les exemples SSOT actuels avec des prix au catalogue TokenLab, DeepSeek V4 Flash est la ligne avec le coût de sortie le plus bas que nous puissions vérifier ici, à 0,147 $ en entrée / 0,294 $ en sortie par MTok.
- Les collisions de noms de modèles sont réelles. DeepSeek V4 Flash apparaît à deux niveaux de prix : 0,147 $/0,294 $ dans le catalogue TokenLab et 0,09 $/0,18 $ dans une liste externe.
- La tarification de la génération vidéo et d'images (PixVerse, fal, Black Forest Labs) ne constitue pas une preuve pour la tarification des tokens LLM. Elle ne devrait jamais apparaître comme citation pour les coûts d'agents textuels, et nous l'avons séparée ci-dessous.
- Les prix de comparaison externes pour Claude Sonnet 5, GLM-5.2, Kimi K2.7 Code, Qwen3.7 Plus et autres manquent d'une source publique datée. Confirmez-les sur la page tarifaire de chaque fournisseur avant d'établir votre budget.
- Le moins cher par token n'est pas automatiquement le moins cher par tâche. Un modèle qui échoue aux appels d'outils ou tronque le JSON force des réessais, ce qui annule les économies.
Instantané des sources et modes de défaillance
| Source | Type de contenu | Date observée | Pertinence pour cet article |
|---|---|---|---|
| Documentation de la plateforme PixVerse (docs.platform.pixverse.ai) | Tarification génération vidéo | 08/07/2026 | Non utilisé pour les affirmations LLM - vidéo uniquement, inclus pour transparence |
| Page du modèle fal PixVerse V6 (fal.ai/pixverse-v6) | Tarification génération vidéo | 08/07/2026 | Non utilisé pour les affirmations LLM - vidéo uniquement |
| Documentation tarifaire Black Forest Labs (docs.bfl.ml) | Tarification génération image | 08/07/2026 | Non utilisé pour les affirmations LLM - image uniquement |
| Catalogue interne des modèles TokenLab | Tarification LLM & média propriétaire | 19/09/2026 | Source principale pour tous les prix du catalogue TokenLab ci-dessous |
| Pages tarifaires des fournisseurs individuels (OpenAI, Anthropic, Google, DeepSeek, Moonshot, Qwen, MiniMax, Z.ai) | Tarification LLM | Non daté dans ce jeu de données | Doit être vérifié indépendamment avant toute affirmation budgétaire publique |
Les sources PixVerse, fal et BFL figurent dans notre ensemble de recherche car nous les avons extraites lors d'un balayage plus large de la tarification des médias. Elles décrivent une facturation vidéo à la seconde et des coûts de crédit par image, qui n'ont aucun rapport avec la tarification LLM par token. Nous les listons ici pour que les lecteurs comprennent pourquoi nous les excluons. Nous ne les utilisons pas pour les affirmations concernant les LLM.
Dans notre pipeline, nous enregistrons les taux de réessai des appels d'outils, le JSON tronqué, les appels d'outils manqués et les arguments de fonction hallucinés en plus des dépenses en tokens. Nous ne disposons pas d'un jeu de données contrôlé sur les taux de réessai pour ces routes exactes au moment de l'actualisation, nous ne pouvons donc pas publier de taux. Par exemple, un modèle à 0,05 $/MTok qui échoue à 15 % des appels d'outils peut coûter plus cher en réessais qu'un modèle à 1 $/MTok qui échoue à 2 %. Ce calcul des modes de défaillance, et non le prix affiché, devrait guider votre choix pour le niveau économique.
Comparaison des modèles et des coûts pour les meilleurs modèles d'IA économiques pour les agents
Tous les prix ci-dessous sont les listes du catalogue propriétaire de TokenLab (par token, exprimé en $/MTok), observées le 19/09/2026. Ils constituent la base correcte pour les affirmations sur les coûts des agents LLM dans cet article.
| Modèle | Fournisseur | Entrée $/MTok | Sortie $/MTok | Adaptation Agent |
|---|---|---|---|---|
| DeepSeek V4 Flash | DeepSeek | 0,147 $ | 0,294 $ | Option SSOT actuelle la plus économique pour les sorties lourdes dans le catalogue TokenLab ; confirmez l'ID exact du modèle avant de comparer avec des devis externes |
| Gemini 3.5 Flash | 1,50 $ | 9,00 $ | Étapes d'agent multimodal (image + utilisation d'outils textuels) | |
| Claude Sonnet 5 | Anthropic | 2,00 $ | 10,00 $ | À réserver pour la vérification finale/QA sur la sortie de l'agent |
| GPT-5.5 | OpenAI | 5,00 $ | 30,00 $ | Solution de secours pour la planification complexe ou la sélection d'outils ambiguë |
| Claude Opus 4.8 | Anthropic | 5,00 $ | 25,00 $ | Comparaison phare ; rarement justifié dans une boucle d'agent |
| Claude Fable 5 | Anthropic | 10,00 $ | 50,00 $ | Plafond premium |
| GLM-5.2 | Z.ai | 0,93 $ | 3,00 $ | Exemple à poids ouvert pour le routage à faible coût |
| Kimi K2.7 Code | Moonshot AI | 0,74 $ | 3,50 $ | Exemple d'agent de codage |
| Qwen3.7 Plus | Alibaba/Qwen | 0,32 $ | 1,28 $ | Exemple de routage à faible coût |
| MiniMax M3 | MiniMax | 0,30 $ | 1,20 $ | Exemple de routage à faible coût |
| DeepSeek V4 Pro | DeepSeek | 0,441 $ | 0,882 $ | Sous-tâches de raisonnement plus lourdes au sein de la même famille |
Nous conservons les chiffres externes ci-dessous pour la continuité de l'audit et marquons chaque ligne comme non vérifiée. Ne les utilisez pas pour la budgétisation. Les détails exacts doivent être confirmés par rapport aux documents actuels.
| Modèle | Fournisseur | Entrée $/MTok | Sortie $/MTok | Statut de vérification |
|---|---|---|---|---|
| DeepSeek V4 Flash (liste externe) | DeepSeek | 0,09 $ | 0,18 $ | Diffère du catalogue TokenLab ci-dessus - confirmez à quel produit/niveau cela se réfère ; aucune URL source datée dans notre ensemble |
| MiniMax M3 | MiniMax | 0,30 $ | 1,20 $ | Aucune URL source datée ; confirmez avec la doc du fournisseur |
| Qwen3.7 Plus | Alibaba/Qwen | 0,32 $ | 1,28 $ | Aucune URL source datée ; confirmez avec la doc du fournisseur |
| Kimi K2.7 Code | Moonshot AI | 0,74 $ | 3,50 $ | Aucune URL source datée ; confirmez avec la doc du fournisseur |
| GLM-5.2 | Z.ai | 0,93 $ | 3,00 $ | Aucune URL source datée ; confirmez avec la doc du fournisseur |
| Claude Sonnet 5 | Anthropic | 2,00 $ | 10,00 $ | Aucune URL source datée ; confirmez avec la doc du fournisseur |
| Claude Opus 4.8 | Anthropic | 5,00 $ | 25,00 $ | Aucune URL source datée ; confirmez avec la doc du fournisseur |
| GPT-5.5 Batch/Flex | OpenAI | 2,50 $ | 15,00 $ | Aucune URL source datée ; pas la ligne standard GPT-5.5 |
| GPT-5.5 | OpenAI | 5,00 $ | 30,00 $ | Aucune URL source datée ; confirmez avec la doc du fournisseur |
| Claude Fable 5 | Anthropic | 10,00 $ | 50,00 $ | Aucune URL source datée ; confirmez avec la doc du fournisseur |
Les points de prix du catalogue retirés ne correspondent plus à un nom de modèle SSOT actuel. Nous conservons les chiffres pour la continuité de l'audit, mais nous ne dirigeons pas de nouveau travail d'agent vers ces niveaux sans nom sans confirmation du fournisseur.
| Niveau retiré ou non-SSOT | Entrée $/MTok | Sortie $/MTok | Statut |
|---|---|---|---|
| Niveau ultra-bas coût retiré | 0,05 $ | 0,40 $ | Plus un exemple SSOT actuel ; confirmez le successeur avant utilisation |
| Niveau flash-lite bas coût retiré | 0,25 $ | 1,50 $ | Plus un exemple SSOT actuel ; mappez vers Gemini 3.5 Flash ou DeepSeek V4 Flash et confirmez |
| Niveau mini bas coût retiré | 0,25 $ | 2,00 $ | Plus un exemple SSOT actuel ; mappez vers Claude Sonnet 5 ou DeepSeek V4 Flash et confirmez |
| Niveau de validation petit retiré | 1,00 $ | 5,00 $ | Plus un exemple SSOT actuel ; mappez vers Claude Sonnet 5 et confirmez |
| Niveau de secours intermédiaire retiré | 1,25 $ | 10,00 $ | Plus un exemple SSOT actuel ; mappez vers GPT-5.5 et confirmez |
| Plafond premium retiré | 15,00 $ | 120,00 $ | Plus un exemple SSOT actuel ; mappez vers GPT-5.5 ou Claude Fable 5 et confirmez |
Notes d'implémentation pour les meilleurs modèles d'IA économiques pour les agents
- Hiérarchisez votre agent par tâche, pas par un seul modèle le moins cher. Dirigez le routage, la classification et la sélection d'outils vers DeepSeek V4 Flash ou Gemini 3.5 Flash. Escaladez la planification multi-étapes vers DeepSeek V4 Pro ou GPT-5.5. Réservez Claude Sonnet 5 pour la vérification de la réponse finale.
- Plafonnez agressivement les tokens de sortie au niveau économique. Étant donné que le coût de sortie domine les dépenses des agents, fixez des limites strictes de tokens max sur les appels DeepSeek V4 Flash et Gemini 3.5 Flash. N'autorisez des générations plus longues qu'au niveau d'escalade.
- Enregistrez les modes de défaillance par modèle, pas seulement le coût par appel. Suivez le JSON tronqué, les appels d'outils manqués et les arguments de fonction hallucinés séparément des dépenses en tokens. Par exemple, un modèle à 0,05 $/MTok qui échoue à 15 % des appels d'outils peut coûter plus cher en réessais qu'un modèle à 1 $/MTok qui échoue à 2 %.
- Épinglez les ID de modèles exacts dans le code, jamais les alias. Étant donné la collision de noms montrée ci-dessus (deux points de prix différents pour DeepSeek V4 Flash), codez en dur la chaîne complète du fournisseur et du modèle. Revérifiez la tarification à chaque mise à jour du fournisseur.
- Revérifiez la tarification externe trimestriellement. Tout ce qui n'a pas d'URL source datée dans cet article doit être réextraite de la page tarifaire en direct du fournisseur avant d'apparaître dans une estimation de coût destinée au client.
Voici un schéma de routage qui utilise les noms de modèles du catalogue dans cet article. La forme exacte de la requête TokenLab et les champs d'erreur d'appel d'outil doivent être confirmés dans la documentation de l'API TokenLab avant une utilisation en production.
Schéma de routage, pas un contrat d'API TokenLab. Confirmez la forme de la requête dans la doc API TokenLab.
for model in ['DeepSeek V4 Flash', 'Gemini 3.5 Flash', 'Claude Sonnet 5']:
réessayer une fois si l'appel d'outil est manquant ou si le JSON est tronqué
si la réponse contient un appel d'outil valide et un JSON valide:
retourner la réponse
enregistrer le mode de défaillance pour ce modèle
lever une erreur après l'échec du niveau final
Ce schéma montre la limite de réessai : attraper une erreur d'appel d'outil, enregistrer le mode de défaillance, puis passer au modèle suivant. Confirmez la forme de la requête et les champs d'erreur dans la documentation actuelle de l'API TokenLab avant la production.
Où TokenLab s'intègre dans le routage d'agents
- Un catalogue unique réduit la jonglerie de comptes par fournisseur. TokenLab expose les niveaux de tarification OpenAI, Google, Anthropic et DeepSeek sous une seule API et surface de facturation. Passer une étape de flux de travail de DeepSeek V4 Flash à Gemini 3.5 Flash devient un changement de configuration, pas une nouvelle intégration.
- Tarification propriétaire et datée que vous pouvez auditer. Contrairement aux devis tiers dispersés, les chiffres du catalogue TokenLab dans cet article sont extraits des propres listes de la plateforme observées le 19/09/2026. C'est pourquoi ce sont les seuls prix présentés ici sans mise en garde "doit être vérifié".
- Hiérarchisation intégrée pour les pipelines d'agents. Parce que TokenLab héberge côte à côte des modèles de niveau économique et de niveau d'escalade, vous pouvez tester A/B le coût et le taux de défaillance entre DeepSeek V4 Flash, Gemini 3.5 Flash et Claude Sonnet 5. Vous n'avez pas besoin de réarchitecturer la logique de routage de votre agent.
Lectures connexes
FAQ
Pourquoi vois-je deux prix pour DeepSeek V4 Flash ?
DeepSeek V4 Flash apparaît à deux points de prix dans notre ensemble de sources : 0,147 $/0,294 $ dans le catalogue TokenLab et 0,09 $/0,18 $ dans une liste externe. Les noms de modèles sont réutilisés et re-tarifiés par les fournisseurs et les revendeurs. Épinglez le fournisseur et l'ID de modèle exacts dans le code, puis revérifiez par rapport aux documents en direct du fournisseur plutôt que de faire confiance au nom seul.
Puis-je utiliser les prix de référence externes pour la budgétisation ?
Pas encore. Ces lignes manquent d'une URL source datée dans notre ensemble, nous les marquons donc comme nécessitant une confirmation du fournisseur. Les chiffres du catalogue TokenLab sont la base de planification, et le tableau externe est un point de départ pour votre propre vérification, pas un chiffre final. Les détails exacts doivent être confirmés par rapport aux documents actuels.
Quel modèle SSOT actuel est le moins cher pour un agent de production ?
Par coût de sortie parmi les exemples SSOT actuels avec des prix au catalogue TokenLab, DeepSeek V4 Flash est le plus bas que nous puissions vérifier ici à 0,294 $/MTok en sortie. La liste externe montre 0,18 $/MTok en sortie, mais ce chiffre nécessite une confirmation du fournisseur. Mesurez le moins cher après avoir pris en compte le taux de réessai sur votre schéma d'appel d'outils spécifique.
Pourquoi PixVerse, fal et BFL sont-ils cités si cet article concerne la tarification LLM ?
Ils ne sont pas cités comme preuve pour une quelconque affirmation de prix LLM. Ils apparaissent uniquement dans le tableau Instantané des sources pour la transparence concernant notre balayage de recherche plus large et sont explicitement marqués comme non utilisés pour les affirmations LLM. Chaque chiffre en dollars dans le tableau Comparaison des modèles et des coûts provient du propre catalogue de TokenLab ou est signalé comme non vérifié.
Comment les réessais d'appels d'outils changent-ils le choix du modèle le moins cher ?
Un modèle bon marché qui échoue aux appels d'outils ou tronque le JSON force des réessais, et ces réessais ajoutent des tokens de sortie. Par exemple, un modèle à 0,05 $/MTok qui échoue à 15 % des appels d'outils peut coûter plus cher en réessais qu'un modèle à 1 $/MTok qui échoue à 2 %. Dans notre pipeline, nous enregistrons les taux de réessai par modèle et comparons le coût par tâche accomplie, pas le coût par token.
Explorez le catalogue de modèles TokenLab et commencez à comparer les coûts dès aujourd'hui : Catalogue de modèles TokenLab.
Sources
Prix observé le 2026-07-07
- PixVerse Platform DocsObservé le 2026-07-08
- fal PixVerse V6 model pageObservé le 2026-07-08
- Black Forest Labs pricing docsObservé le 2026-07-08
- fal FLUX.2 model pageObservé le 2026-07-08
- Google AI Gemini API pricingObservé le 2026-07-08
- Claude Platform pricingObservé le 2026-07-08
- OpenAI API pricingObservé le 2026-07-08
- DeepSeek API pricingObservé le 2026-07-08



