Receber um erro 404 porque uma string de modelo mudou é uma péssima maneira de começar um loop de agente. A API do Gemini 3.5 Flash vale a pena ser integrada a um loop de agente rápido, mas apenas após confirmar o ID exato do modelo gemini-3.5-flash na lista de modelos ativos. O Google Cloud lista o Gemini 3.5 Flash a US$ 1,50 por 1 milhão de tokens de entrada e US$ 9,00 por 1 milhão de tokens de saída de texto no nível Global padrão, com preços Flex/Batch a US$ 0,75 para entrada e US$ 4,50 para saída. Vimos a mesma armadilha na fonte: um ID de modelo que funciona hoje pode gerar um 404 amanhã. Tabelas de preços online frequentemente misturam preços confirmados pelos fornecedores com listagens de diretórios que não foram verificadas. Este guia aborda o que é verificável agora, o que não é e como construir um loop de agente que não quebre quando um ID de modelo mudar.
Principais conclusões
- A página de preços da Agent Platform do Google Cloud lista o Gemini 3.5 Flash a US$ 1,50/M de tokens de entrada e US$ 9,00/M de tokens de saída no nível Global padrão, correspondendo à listagem do diretório do TokenLab no momento da atualização.
- A string exata do modelo a ser fixada é
gemini-3.5-flash; a página de modelos da Gemini API do Google a lista como um exemplo de modelo estável. Ainda assim, confirme através da lista de modelos ativos antes de implantar. - Rotear através da API unificada do TokenLab significa que você não precisa codificar uma string de SDK específica do fornecedor; o TokenLab mapeia um slug de modelo estável para qualquer identificador subjacente que seja válido no momento.
- Os preços dos concorrentes na tabela abaixo (GPT-5.5, Claude Sonnet 5, DeepSeek V4 Flash) vêm apenas do diretório do TokenLab. Nenhuma página de preços independente de fornecedor foi fornecida para esses modelos nesta análise — verifique diretamente com OpenAI, Anthropic e DeepSeek antes de fazer o orçamento com base neles.
- Nenhum valor de latência de benchmark (tempo para o primeiro token, duração total do loop de 5 etapas) é citado aqui porque nenhum foi obtido de forma independente. Instrumente seu próprio loop e meça o p50/p95 por etapa em vez de citar números de segunda mão.
- Em loops de agentes, os tokens de saída geralmente dominam os gastos — a taxa de saída do Gemini 3.5 Flash (US$ 9,00/M) é 6 vezes maior que sua taxa de entrada (US$ 1,50/M), portanto, limitar
max_output_tokensé mais importante do que reduzir o tamanho do prompt.
Snapshot da fonte
| Fonte | O que cobre | Data observada |
|---|---|---|
| Preços da Agent Platform do Google Cloud | Preços de tokens do Gemini 3.5 Flash padrão, cached-input e Flex/Batch | 08/07/2026 |
| Página de modelos da Gemini API do Google | Orientação sobre nomenclatura de modelos estáveis; gemini-3.5-flash listado como exemplo de modelo estável |
08/07/2026 |
| Diretório de modelos e preços do TokenLab | Preços por token para gemini-3.5-flash e modelos concorrentes no Google, Anthropic, OpenAI e DeepSeek |
08/07/2026 |
A Gemini Enterprise Agent Platform do Google Cloud lista o Gemini 3.5 Flash em sua própria tabela de preços, separada da página de preços da Gemini Developer API. As taxas globais padrão são de US$ 1,50 por 1 milhão de tokens de entrada e US$ 9,00 por 1 milhão de tokens de saída de texto. As taxas globais Flex/Batch caem para US$ 0,75 de entrada e US$ 4,50 de saída. O input em cache no nível padrão custa US$ 0,15 por 1 milhão de tokens. Esta é uma evidência direta de que o Gemini 3.5 Flash é um modelo estável e geralmente disponível, precificado para cargas de trabalho de agentes corporativos no Google Cloud, e não um marcador ou rótulo de visualização. Leitores que comparam custos entre artigos devem verificar de qual página de preços uma taxa foi extraída antes de tratar os números como intercambiáveis.
Comparação de modelo e custo para a API do Gemini 3.5 Flash
Todos os valores abaixo são listagens do diretório do TokenLab. As linhas marcadas como 'verificar com o fornecedor' não possuem citação independente fornecida para esta análise.
| Modelo | Fornecedor | Janela de contexto | Entrada $/M tokens | Saída $/M tokens | Nota |
|---|---|---|---|---|---|
| gemini-3.5-flash | 1.048.576 | US$ 1,50 | US$ 9,00 | Diretório TokenLab; verificar na página de preços ativos do Google | |
| gemini-3.1-flash-lite | n/a | US$ 0,25 | US$ 1,50 | Diretório TokenLab | |
| gemini-3-pro-image | n/a | US$ 2,00 | US$ 12,00 | Diretório TokenLab, nível de imagem; não usar como substituto de agente de texto | |
| gpt-5 | OpenAI | n/a | US$ 1,25 | US$ 10,00 | Diretório TokenLab |
| gpt-5.5 | OpenAI | 1.050.000 | US$ 5,00 | US$ 30,00 | Diretório TokenLab - verificar com OpenAI |
| claude-sonnet-5 | Anthropic | 1.000.000 | US$ 2,00 | US$ 10,00 | Diretório TokenLab - verificar com Anthropic |
| claude-haiku-4-5 | Anthropic | n/a | US$ 1,00 | US$ 5,00 | Diretório TokenLab |
| deepseek-v4-flash | DeepSeek | 1.048.576 | US$ 0,09 | US$ 0,18 | Diretório TokenLab - verificar com DeepSeek |
Para loops de agentes que realizam muitas pequenas chamadas de ferramentas, a taxa por token mais barata nem sempre é a taxa por tarefa mais barata — um modelo que precisa de menos tentativas ou rastreamentos de raciocínio mais curtos pode superar um preço de etiqueta menor. Meça o custo por tarefa concluída, não apenas o custo por token.
Etapas de implementação para a API do Gemini 3.5 Flash
Confirme o ID do modelo antes de escrever o código. No momento da atualização, o ID do modelo a ser fixado era
gemini-3.5-flash, e a documentação de modelos do Google o lista como um exemplo de modelo estável. Ainda assim, chame o endpoint de lista de modelos do seu fornecedor ou verifique o diretório do TokenLab antes da implantação. Esta é a solução para o problema de "o SDK gerou um erro": a string não existia no momento da chamada. Nenhuma lógica de repetição corrige um identificador errado. Por exemplo, a fonte descreve esse modo de falha diretamente.Roteie através de um endpoint unificado em vez de um SDK de fornecedor bruto. Usar o TokenLab (ou um gateway semelhante) significa que o código da sua aplicação referencia um slug estável, e o gateway o resolve para qualquer identificador válido atual do fornecedor. Isso desacopla seu loop de agente de renomeações ou depreciações de modelos por parte do fornecedor.
Construa o loop com etapas explícitas e instrumentação:
# Estrutura ilustrativa apenas - confirme o endpoint/modelo exato
# em relação à documentação atual do seu gateway antes de implantar.
import time
def agent_loop(task):
timings = {}
t0 = time.time()
plan = call_model(model="gemini-3.5-flash", prompt=build_plan_prompt(task))
timings["plan"] = time.time() - t0
t0 = time.time()
context = retrieve_context(plan)
timings["retrieve"] = time.time() - t0
t0 = time.time()
tool_result = call_tool(plan, context)
timings["tool_call"] = time.time() - t0
t0 = time.time()
synthesis = call_model(
model="gemini-3.5-flash",
prompt=build_synthesis_prompt(tool_result),
max_output_tokens=512,
)
timings["synthesize"] = time.time() - t0
t0 = time.time()
response = format_response(synthesis)
timings["respond"] = time.time() - t0
return response, timings
Em nosso pipeline, registramos timings por execução e calculamos nosso próprio p50/p95 em um lote representativo de tarefas. Não publique ou confie em um número fixo de "N segundos por loop" extraído do ambiente de outra pessoa — condições de rede, tamanho do prompt e carga do fornecedor alteram esses números.
Limite os tokens de saída deliberadamente. Os tokens de saída custam aproximadamente 6 vezes mais que os tokens de entrada para o
gemini-3.5-flash, de acordo com os preços do diretório acima. Testamos a matemática dos preços. Definamax_output_tokenspor etapa em vez de deixar o modelo rodar por muito tempo. Isso é mais importante na etapa de síntese, onde respostas verbosas são comuns.Adicione uma cadeia de fallback. Configure um modelo secundário (por exemplo,
gemini-3.1-flash-litepara custo, ou um fornecedor totalmente diferente) para que uma única interrupção ou depreciação de modelo não derrube todo o seu agente.
Quando usar o TokenLab
- Você deseja um slug de modelo estável em vez de uma string de fornecedor frágil. A abordagem de diretório do TokenLab significa que seu código não precisa ser reescrito toda vez que um fornecedor renomeia ou deprecia um modelo. O desligamento do Veo 3.0 do Google está agendado para 30 de junho de 2026, o que mostra o risco.
- Você precisa de um lugar para comparar custos entre fornecedores antes de se comprometer com um, em vez de verificar manualmente quatro páginas de preços separadas toda vez que avalia uma troca de modelo.
- Você está executando uma lógica de fallback de vários fornecedores e deseja uma forma de solicitação/resposta consistente entre modelos do Google, Anthropic, OpenAI e DeepSeek em vez de manter quatro integrações de SDK separadas.
Leitura relacionada
FAQ
O gemini-3.5-flash é um ID de modelo válido que posso chamar diretamente no SDK do Google?
Não presuma isso. Confirme na lista de modelos atual do Google antes de implantar — as strings de ID de modelo mudam, e o status de visualização/GA muda com o tempo. Se você estiver roteando através do TokenLab, o gateway cuida desse mapeamento para você.
De onde vêm os preços dos concorrentes na tabela de comparação?
Eles são listagens do diretório do TokenLab. Apenas os preços de vídeo do Veo neste artigo remontam a uma fonte do Google com data independente (observada em 08/07/2026). Os preços do GPT-5.5, Claude Sonnet 5 e DeepSeek V4 Flash aqui não possuem citação independente fornecida — verifique com cada fornecedor antes de usar esses números em uma estimativa de custo voltada para o cliente.
Quão rápido é um loop de agente de 5 etapas do Gemini 3.5 Flash?
Nenhum valor de benchmark está incluído aqui porque nenhum foi obtido de forma independente para este artigo. Instrumente seu próprio loop (veja o exemplo de código acima) e meça a latência p50/p95 real em seu ambiente, em vez de confiar em um número de segunda mão.
O que acontece se o modelo que estou usando for depreciado no meio do projeto?
Este é exatamente o cenário que o desligamento do Veo 3.0 do Google (30 de junho de 2026) ilustra. Construa uma cadeia de fallback e, sempre que possível, roteie através de um gateway que mantenha slugs de modelo atualizados para que uma depreciação não exija uma reescrita de código.
Crie uma chave de API do TokenLab para comparar IDs de modelos atuais antes de implantar.
Fontes
Preço observado em 2026-07-08
- Google AI Gemini API pricingObservado em 2026-07-08
- Google Cloud Agent Platform pricingObservado em 2026-07-08
- Google Gemini API modelsObservado em 2026-07-08
- TokenLab model directoryObservado em 2026-07-07



