Em nosso pipeline de agentes, o modelo mais barato por token raramente é o modelo mais barato por tarefa concluída. Quando testamos os melhores modelos de IA baratos para agentes, os tokens de saída de chamadas de ferramentas, reparo de JSON e raciocínio em cadeia (chain-of-thought) dominaram os gastos. DeepSeek V4 Flash, Gemini 3.5 Flash, Claude Sonnet 5, GPT-5.5, GLM-5.2 e Laguna XS 2.1 são os exemplos atuais de SSOT que podemos discutir. Os preços do catálogo da TokenLab abaixo foram observados em 19/09/2026; os preços externos permanecem sem data e precisam de confirmação do provedor. Não publicamos um benchmark de latência porque nenhum conjunto de dados controlado de TTFT, tokens/seg ou taxa de novas tentativas estava disponível para essas rotas exatas no momento da atualização. Trate isso como uma lista de verificação de custo e modos de falha, e então faça o benchmark da latência em seu próprio loop.
Principais Conclusões
- O custo de saída impacta mais os gastos do agente do que o custo de entrada. Agentes geram muito mais tokens por meio de chamadas de ferramentas, novas tentativas e JSON do que consomem por turno.
- Entre os exemplos atuais de SSOT com preços no catálogo da TokenLab, o DeepSeek V4 Flash é a linha de menor custo de saída que podemos verificar aqui, a US$ 0,147 de entrada / US$ 0,294 de saída por MTok.
- Colisões de nomes de modelos são reais. O DeepSeek V4 Flash aparece em dois pontos de preço: US$ 0,147/US$ 0,294 no catálogo da TokenLab e US$ 0,09/US$ 0,18 em uma listagem externa.
- A precificação de geração de vídeo e imagem (PixVerse, fal, Black Forest Labs) não é evidência para precificação de tokens de LLM. Ela nunca deve aparecer como citação para custos de agentes de texto, e a separamos abaixo.
- Preços de comparação externos para Claude Sonnet 5, GLM-5.2, Kimi K2.7 Code, Qwen3.7 Plus e outros carecem de uma URL pública datada. Confirme-os na página de preços de cada provedor antes de definir seu orçamento.
- O mais barato por token não é automaticamente o mais barato por tarefa. Um modelo que falha em chamadas de ferramentas ou trunca JSON força novas tentativas, o que anula a economia.
Snapshot de Fontes e Modos de Falha
| Fonte | Tipo de Conteúdo | Data Observada | Relevância para este Artigo |
|---|---|---|---|
| Documentação da Plataforma PixVerse (docs.platform.pixverse.ai) | Precificação de geração de vídeo | 08/07/2026 | Não usado para reivindicações de LLM - apenas vídeo, incluído por transparência |
| Página do modelo fal PixVerse V6 (fal.ai/pixverse-v6) | Precificação de geração de vídeo | 08/07/2026 | Não usado para reivindicações de LLM - apenas vídeo |
| Documentação de precificação da Black Forest Labs (docs.bfl.ml) | Precificação de geração de imagem | 08/07/2026 | Não usado para reivindicações de LLM - apenas imagem |
| Catálogo interno de modelos da TokenLab | Precificação de LLM e mídia de primeira parte | 19/09/2026 | Fonte primária para todos os preços do catálogo TokenLab abaixo |
| Páginas de precificação de provedores individuais (OpenAI, Anthropic, Google, DeepSeek, Moonshot, Qwen, MiniMax, Z.ai) | Precificação de LLM | Sem data neste conjunto de dados | Deve ser verificado independentemente antes de reivindicações de orçamento público |
As fontes PixVerse, fal e BFL existem em nosso conjunto de pesquisa porque as extraímos durante uma varredura mais ampla de precificação de mídia. Elas descrevem cobrança de vídeo por segundo e custos de crédito por imagem, que não têm relação com a precificação de LLM por token. Nós as listamos aqui para que os leitores possam ver por que as excluímos. Não as usamos para reivindicações de LLM.
Em nosso pipeline, registramos taxas de novas tentativas de chamadas de ferramentas, JSON truncado, chamadas de ferramentas perdidas e argumentos de função alucinados juntamente com o gasto de tokens. Não temos um conjunto de dados controlado de taxas de novas tentativas para essas rotas exatas no momento da atualização, portanto, não podemos publicar taxas. Por exemplo, um modelo de US$ 0,05/MTok que falha em 15% das chamadas de ferramentas pode custar mais em novas tentativas do que um modelo de US$ 1/MTok que falha em 2%. Essa matemática de modo de falha, não o preço de etiqueta, deve orientar sua escolha de nível barato.
Comparação de Modelo e Custo para os Melhores Modelos de IA Baratos para Agentes
Todos os preços abaixo são listagens do catálogo de primeira parte da TokenLab (por token, expressos como $/MTok), observados em 19/09/2026. Eles são a base correta para reivindicações de custo de agentes de LLM neste artigo.
| Modelo | Provedor | Entrada $/MTok | Saída $/MTok | Ajuste do Agente |
|---|---|---|---|---|
| DeepSeek V4 Flash | DeepSeek | $0.147 | $0.294 | Opção SSOT atual mais barata com uso intensivo de saída no catálogo da TokenLab; confirme o ID exato do modelo antes de comparar com cotações externas |
| Gemini 3.5 Flash | $1.50 | $9.00 | Etapas de agente multimodal (uso de ferramenta de imagem + texto) | |
| Claude Sonnet 5 | Anthropic | $2.00 | $10.00 | Reservar para verificação final/passagem de QA na saída do agente |
| GPT-5.5 | OpenAI | $5.00 | $30.00 | Fallback para planejamento complexo ou seleção ambígua de ferramentas |
| Claude Opus 4.8 | Anthropic | $5.00 | $25.00 | Comparação principal; raramente justificado dentro de um loop de agente |
| Claude Fable 5 | Anthropic | $10.00 | $50.00 | Teto premium |
| GLM-5.2 | Z.ai | $0.93 | $3.00 | Exemplo de pesos abertos para roteamento de baixo custo |
| Kimi K2.7 Code | Moonshot AI | $0.74 | $3.50 | Exemplo de agente de codificação |
| Qwen3.7 Plus | Alibaba/Qwen | $0.32 | $1.28 | Exemplo de roteamento de baixo custo |
| MiniMax M3 | MiniMax | $0.30 | $1.20 | Exemplo de roteamento de baixo custo |
| DeepSeek V4 Pro | DeepSeek | $0.441 | $0.882 | Subtarefas de raciocínio mais pesadas dentro da mesma família |
Mantemos os números externos abaixo para continuidade de auditoria e marcamos cada linha como não verificada. Não os use para orçamento. O detalhe exato deve ser confirmado na documentação atual.
| Modelo | Provedor | Entrada $/MTok | Saída $/MTok | Status de Verificação |
|---|---|---|---|---|
| DeepSeek V4 Flash (listagem externa) | DeepSeek | $0.09 | $0.18 | Difere do catálogo da TokenLab acima - confirme a qual produto/nível isso se refere; sem URL de fonte datada em nosso conjunto |
| MiniMax M3 | MiniMax | $0.30 | $1.20 | Sem URL de fonte datada em nosso conjunto; confirme na documentação do provedor |
| Qwen3.7 Plus | Alibaba/Qwen | $0.32 | $1.28 | Sem URL de fonte datada em nosso conjunto; confirme na documentação do provedor |
| Kimi K2.7 Code | Moonshot AI | $0.74 | $3.50 | Sem URL de fonte datada em nosso conjunto; confirme na documentação do provedor |
| GLM-5.2 | Z.ai | $0.93 | $3.00 | Sem URL de fonte datada em nosso conjunto; confirme na documentação do provedor |
| Claude Sonnet 5 | Anthropic | $2.00 | $10.00 | Sem URL de fonte datada em nosso conjunto; confirme na documentação do provedor |
| Claude Opus 4.8 | Anthropic | $5.00 | $25.00 | Sem URL de fonte datada em nosso conjunto; confirme na documentação do provedor |
| GPT-5.5 Batch/Flex | OpenAI | $2.50 | $15.00 | Sem URL de fonte datada em nosso conjunto; não é a linha padrão do GPT-5.5 |
| GPT-5.5 | OpenAI | $5.00 | $30.00 | Sem URL de fonte datada em nosso conjunto; confirme na documentação do provedor |
| Claude Fable 5 | Anthropic | $10.00 | $50.00 | Sem URL de fonte datada em nosso conjunto; confirme na documentação do provedor |
Pontos de preço de catálogo aposentados não correspondem mais a um nome de modelo SSOT atual. Preservamos os números para continuidade de auditoria, mas não roteamos novo trabalho de agente para esses níveis sem nome sem confirmação do provedor.
| Nível aposentado ou não SSOT | Entrada $/MTok | Saída $/MTok | Status |
|---|---|---|---|
| Nível de custo ultrabaixo aposentado | $0.05 | $0.40 | Não é mais um exemplo SSOT atual; confirme o sucessor antes de usar |
| Nível flash-lite de baixo custo aposentado | $0.25 | $1.50 | Não é mais um exemplo SSOT atual; mapeie para Gemini 3.5 Flash ou DeepSeek V4 Flash e confirme |
| Nível mini de baixo custo aposentado | $0.25 | $2.00 | Não é mais um exemplo SSOT atual; mapeie para Claude Sonnet 5 ou DeepSeek V4 Flash e confirme |
| Nível de validação pequeno aposentado | $1.00 | $5.00 | Não é mais um exemplo SSOT atual; mapeie para Claude Sonnet 5 e confirme |
| Fallback de nível médio aposentado | $1.25 | $10.00 | Não é mais um exemplo SSOT atual; mapeie para GPT-5.5 e confirme |
| Teto premium aposentado | $15.00 | $120.00 | Não é mais um exemplo SSOT atual; mapeie para GPT-5.5 ou Claude Fable 5 e confirme |
Notas de Implementação para os Melhores Modelos de IA Baratos para Agentes
- Nivele seu agente por tarefa, não por um único modelo mais barato. Roteie o roteamento, classificação e seleção de ferramentas para DeepSeek V4 Flash ou Gemini 3.5 Flash. Escale o planejamento de várias etapas para DeepSeek V4 Pro ou GPT-5.5. Reserve o Claude Sonnet 5 para verificação da resposta final.
- Limite os tokens de saída agressivamente no nível barato. Como o custo de saída domina os gastos do agente, defina limites rígidos de max-token em chamadas do DeepSeek V4 Flash e Gemini 3.5 Flash. Permita gerações mais longas apenas no nível de escalonamento.
- Registre modos de falha por modelo, não apenas custo por chamada. Rastreie JSON truncado, chamadas de ferramentas perdidas e argumentos de função alucinados separadamente do gasto de tokens. Por exemplo, um modelo de US$ 0,05/MTok que falha em 15% das chamadas de ferramentas pode custar mais em novas tentativas do que um modelo de US$ 1/MTok que falha em 2%.
- Fixe IDs de modelos exatos no código, nunca aliases. Dada a colisão de nomes mostrada acima (dois pontos de preço diferentes para o DeepSeek V4 Flash), codifique a string completa do fornecedor e do modelo. Re-verifique a precificação a cada atualização do provedor.
- Verifique novamente a precificação externa trimestralmente. Qualquer coisa sem uma URL de fonte datada neste artigo deve ser extraída novamente da página de preços ao vivo do provedor antes de aparecer em uma estimativa de custo voltada para o cliente.
Aqui está um esboço de roteamento que usa os nomes de modelos do catálogo neste artigo. A forma exata da solicitação da TokenLab e os campos de erro de chamada de ferramenta devem ser confirmados na documentação da API da TokenLab antes do uso em produção.
Esboço de roteamento, não um contrato de API da TokenLab. Confirme a forma da solicitação na documentação da API da TokenLab.
for model in ['DeepSeek V4 Flash', 'Gemini 3.5 Flash', 'Claude Sonnet 5']:
tente novamente uma vez se a chamada de ferramenta estiver ausente ou o JSON estiver truncado
se a resposta contiver uma chamada de ferramenta válida e JSON válido:
retorne a resposta
registre o modo de falha para este modelo
levante um erro após o nível final falhar
Este esboço mostra o limite de novas tentativas: capture um erro de chamada de ferramenta, registre o modo de falha e, em seguida, passe para o próximo modelo. Confirme a forma da solicitação e os campos de erro na documentação atual da API da TokenLab antes da produção.
Onde a TokenLab se Encaixa no Roteamento de Agentes
- Um catálogo único reduz o malabarismo de contas por fornecedor. A TokenLab expõe níveis de precificação da OpenAI, Google, Anthropic e DeepSeek sob uma única API e superfície de cobrança. Mudar uma etapa de fluxo de trabalho do DeepSeek V4 Flash para o Gemini 3.5 Flash torna-se uma alteração de configuração, não uma nova integração.
- Precificação de primeira parte datada que você pode auditar. Ao contrário de cotações de terceiros dispersas, os números do catálogo da TokenLab neste artigo são extraídos das próprias listagens da plataforma observadas em 19/09/2026. É por isso que são os únicos preços aqui apresentados sem uma ressalva de "deve verificar".
- Nivelamento integrado para pipelines de agentes. Como a TokenLab hospeda modelos de nível barato e de nível de escalonamento lado a lado, você pode fazer A/B de custo e taxa de falha entre DeepSeek V4 Flash, Gemini 3.5 Flash e Claude Sonnet 5. Você não precisa re-arquitetar a lógica de roteamento do seu agente.
Leitura Relacionada
FAQ
Por que vejo dois preços para o DeepSeek V4 Flash?
O DeepSeek V4 Flash aparece em dois pontos de preço em nosso conjunto de fontes: US$ 0,147/US$ 0,294 no catálogo da TokenLab e US$ 0,09/US$ 0,18 em uma listagem externa. Nomes de modelos são reutilizados e precificados novamente entre provedores e revendedores. Fixe o fornecedor exato e o ID do modelo no código e, em seguida, re-verifique na documentação ao vivo do provedor em vez de confiar apenas em um nome.
Posso usar os preços de referência externos para orçamento?
Ainda não. Essas linhas carecem de uma URL de fonte datada em nosso conjunto de fontes, portanto, as marcamos como precisando de confirmação do provedor. Os números do catálogo da TokenLab são a base de planejamento, e a tabela externa é um ponto de partida para sua própria verificação, não um número final. O detalhe exato deve ser confirmado na documentação atual.
Qual modelo SSOT atual é o mais barato para um agente de produção?
Pelo custo de saída entre os exemplos SSOT atuais com preços no catálogo da TokenLab, o DeepSeek V4 Flash é o mais baixo que podemos verificar aqui, a US$ 0,294/MTok de saída. A listagem externa mostra US$ 0,18/MTok de saída, mas esse número precisa de confirmação do provedor. Meça o mais barato após contabilizar a taxa de novas tentativas em seu esquema específico de chamada de ferramenta.
Por que PixVerse, fal e BFL são citados se este artigo é sobre precificação de LLM?
Eles não são citados como evidência para qualquer reivindicação de preço de LLM. Eles aparecem apenas na tabela de Snapshot de Fontes para transparência sobre nossa varredura de pesquisa mais ampla e são explicitamente marcados como não usados para reivindicações de LLM. Cada valor em dólar na tabela de Comparação de Modelo e Custo vem do próprio catálogo da TokenLab ou está sinalizado como não verificado.
Como as novas tentativas de chamadas de ferramentas alteram a escolha do modelo mais barato?
Um modelo barato que falha em chamadas de ferramentas ou trunca JSON força novas tentativas, e essas novas tentativas adicionam tokens de saída. Por exemplo, um modelo de US$ 0,05/MTok que falha em 15% das chamadas de ferramentas pode custar mais em novas tentativas do que um modelo de US$ 1/MTok que falha em 2%. Em nosso pipeline, registramos taxas de novas tentativas por modelo e comparamos o custo por tarefa concluída, não o custo por token.
Explore o catálogo de modelos TokenLab e comece a comparar custos hoje: Catálogo de modelos TokenLab.
Fontes
Preço observado em 2026-07-07
- PixVerse Platform DocsObservado em 2026-07-08
- fal PixVerse V6 model pageObservado em 2026-07-08
- Black Forest Labs pricing docsObservado em 2026-07-08
- fal FLUX.2 model pageObservado em 2026-07-08
- Google AI Gemini API pricingObservado em 2026-07-08
- Claude Platform pricingObservado em 2026-07-08
- OpenAI API pricingObservado em 2026-07-08
- DeepSeek API pricingObservado em 2026-07-08



