Escolha Auto, TokenLab Verified ou Official para cada solicitação, com preços exibidos antecipadamente.Veja as novidades

API do Gemini 3.5 Flash para loops de agentes rápidos

·19 de setembro de 2026·9 min de leitura·Atualizado 26 de setembro de 2026·1524 visualizações
#programação#api de ia#TokenLab
API do Gemini 3.5 Flash para loops de agentes rápidos

Receber um erro 404 porque uma string de modelo mudou é uma péssima maneira de começar um loop de agente. A API do Gemini 3.5 Flash vale a pena ser integrada a um loop de agente rápido, mas apenas após confirmar o ID exato do modelo gemini-3.5-flash na lista de modelos ativos. O Google Cloud lista o Gemini 3.5 Flash a US$ 1,50 por 1 milhão de tokens de entrada e US$ 9,00 por 1 milhão de tokens de saída de texto no nível Global padrão, com preços Flex/Batch a US$ 0,75 para entrada e US$ 4,50 para saída. Vimos a mesma armadilha na fonte: um ID de modelo que funciona hoje pode gerar um 404 amanhã. Tabelas de preços online frequentemente misturam preços confirmados pelos fornecedores com listagens de diretórios que não foram verificadas. Este guia aborda o que é verificável agora, o que não é e como construir um loop de agente que não quebre quando um ID de modelo mudar.

Principais conclusões

  • A página de preços da Agent Platform do Google Cloud lista o Gemini 3.5 Flash a US$ 1,50/M de tokens de entrada e US$ 9,00/M de tokens de saída no nível Global padrão, correspondendo à listagem do diretório do TokenLab no momento da atualização.
  • A string exata do modelo a ser fixada é gemini-3.5-flash; a página de modelos da Gemini API do Google a lista como um exemplo de modelo estável. Ainda assim, confirme através da lista de modelos ativos antes de implantar.
  • Rotear através da API unificada do TokenLab significa que você não precisa codificar uma string de SDK específica do fornecedor; o TokenLab mapeia um slug de modelo estável para qualquer identificador subjacente que seja válido no momento.
  • Os preços dos concorrentes na tabela abaixo (GPT-5.5, Claude Sonnet 5, DeepSeek V4 Flash) vêm apenas do diretório do TokenLab. Nenhuma página de preços independente de fornecedor foi fornecida para esses modelos nesta análise — verifique diretamente com OpenAI, Anthropic e DeepSeek antes de fazer o orçamento com base neles.
  • Nenhum valor de latência de benchmark (tempo para o primeiro token, duração total do loop de 5 etapas) é citado aqui porque nenhum foi obtido de forma independente. Instrumente seu próprio loop e meça o p50/p95 por etapa em vez de citar números de segunda mão.
  • Em loops de agentes, os tokens de saída geralmente dominam os gastos — a taxa de saída do Gemini 3.5 Flash (US$ 9,00/M) é 6 vezes maior que sua taxa de entrada (US$ 1,50/M), portanto, limitar max_output_tokens é mais importante do que reduzir o tamanho do prompt.

Snapshot da fonte

Fonte O que cobre Data observada
Preços da Agent Platform do Google Cloud Preços de tokens do Gemini 3.5 Flash padrão, cached-input e Flex/Batch 08/07/2026
Página de modelos da Gemini API do Google Orientação sobre nomenclatura de modelos estáveis; gemini-3.5-flash listado como exemplo de modelo estável 08/07/2026
Diretório de modelos e preços do TokenLab Preços por token para gemini-3.5-flash e modelos concorrentes no Google, Anthropic, OpenAI e DeepSeek 08/07/2026

A Gemini Enterprise Agent Platform do Google Cloud lista o Gemini 3.5 Flash em sua própria tabela de preços, separada da página de preços da Gemini Developer API. As taxas globais padrão são de US$ 1,50 por 1 milhão de tokens de entrada e US$ 9,00 por 1 milhão de tokens de saída de texto. As taxas globais Flex/Batch caem para US$ 0,75 de entrada e US$ 4,50 de saída. O input em cache no nível padrão custa US$ 0,15 por 1 milhão de tokens. Esta é uma evidência direta de que o Gemini 3.5 Flash é um modelo estável e geralmente disponível, precificado para cargas de trabalho de agentes corporativos no Google Cloud, e não um marcador ou rótulo de visualização. Leitores que comparam custos entre artigos devem verificar de qual página de preços uma taxa foi extraída antes de tratar os números como intercambiáveis.

Comparação de modelo e custo para a API do Gemini 3.5 Flash

Todos os valores abaixo são listagens do diretório do TokenLab. As linhas marcadas como 'verificar com o fornecedor' não possuem citação independente fornecida para esta análise.

Modelo Fornecedor Janela de contexto Entrada $/M tokens Saída $/M tokens Nota
gemini-3.5-flash Google 1.048.576 US$ 1,50 US$ 9,00 Diretório TokenLab; verificar na página de preços ativos do Google
gemini-3.1-flash-lite Google n/a US$ 0,25 US$ 1,50 Diretório TokenLab
gemini-3-pro-image Google n/a US$ 2,00 US$ 12,00 Diretório TokenLab, nível de imagem; não usar como substituto de agente de texto
gpt-5 OpenAI n/a US$ 1,25 US$ 10,00 Diretório TokenLab
gpt-5.5 OpenAI 1.050.000 US$ 5,00 US$ 30,00 Diretório TokenLab - verificar com OpenAI
claude-sonnet-5 Anthropic 1.000.000 US$ 2,00 US$ 10,00 Diretório TokenLab - verificar com Anthropic
claude-haiku-4-5 Anthropic n/a US$ 1,00 US$ 5,00 Diretório TokenLab
deepseek-v4-flash DeepSeek 1.048.576 US$ 0,09 US$ 0,18 Diretório TokenLab - verificar com DeepSeek

Para loops de agentes que realizam muitas pequenas chamadas de ferramentas, a taxa por token mais barata nem sempre é a taxa por tarefa mais barata — um modelo que precisa de menos tentativas ou rastreamentos de raciocínio mais curtos pode superar um preço de etiqueta menor. Meça o custo por tarefa concluída, não apenas o custo por token.

Etapas de implementação para a API do Gemini 3.5 Flash

  1. Confirme o ID do modelo antes de escrever o código. No momento da atualização, o ID do modelo a ser fixado era gemini-3.5-flash, e a documentação de modelos do Google o lista como um exemplo de modelo estável. Ainda assim, chame o endpoint de lista de modelos do seu fornecedor ou verifique o diretório do TokenLab antes da implantação. Esta é a solução para o problema de "o SDK gerou um erro": a string não existia no momento da chamada. Nenhuma lógica de repetição corrige um identificador errado. Por exemplo, a fonte descreve esse modo de falha diretamente.

  2. Roteie através de um endpoint unificado em vez de um SDK de fornecedor bruto. Usar o TokenLab (ou um gateway semelhante) significa que o código da sua aplicação referencia um slug estável, e o gateway o resolve para qualquer identificador válido atual do fornecedor. Isso desacopla seu loop de agente de renomeações ou depreciações de modelos por parte do fornecedor.

  3. Construa o loop com etapas explícitas e instrumentação:

# Estrutura ilustrativa apenas - confirme o endpoint/modelo exato
# em relação à documentação atual do seu gateway antes de implantar.
import time

def agent_loop(task):
    timings = {}

    t0 = time.time()
    plan = call_model(model="gemini-3.5-flash", prompt=build_plan_prompt(task))
    timings["plan"] = time.time() - t0

    t0 = time.time()
    context = retrieve_context(plan)
    timings["retrieve"] = time.time() - t0

    t0 = time.time()
    tool_result = call_tool(plan, context)
    timings["tool_call"] = time.time() - t0

    t0 = time.time()
    synthesis = call_model(
        model="gemini-3.5-flash",
        prompt=build_synthesis_prompt(tool_result),
        max_output_tokens=512,
    )
    timings["synthesize"] = time.time() - t0

    t0 = time.time()
    response = format_response(synthesis)
    timings["respond"] = time.time() - t0

    return response, timings

Em nosso pipeline, registramos timings por execução e calculamos nosso próprio p50/p95 em um lote representativo de tarefas. Não publique ou confie em um número fixo de "N segundos por loop" extraído do ambiente de outra pessoa — condições de rede, tamanho do prompt e carga do fornecedor alteram esses números.

  1. Limite os tokens de saída deliberadamente. Os tokens de saída custam aproximadamente 6 vezes mais que os tokens de entrada para o gemini-3.5-flash, de acordo com os preços do diretório acima. Testamos a matemática dos preços. Defina max_output_tokens por etapa em vez de deixar o modelo rodar por muito tempo. Isso é mais importante na etapa de síntese, onde respostas verbosas são comuns.

  2. Adicione uma cadeia de fallback. Configure um modelo secundário (por exemplo, gemini-3.1-flash-lite para custo, ou um fornecedor totalmente diferente) para que uma única interrupção ou depreciação de modelo não derrube todo o seu agente.

Quando usar o TokenLab

  • Você deseja um slug de modelo estável em vez de uma string de fornecedor frágil. A abordagem de diretório do TokenLab significa que seu código não precisa ser reescrito toda vez que um fornecedor renomeia ou deprecia um modelo. O desligamento do Veo 3.0 do Google está agendado para 30 de junho de 2026, o que mostra o risco.
  • Você precisa de um lugar para comparar custos entre fornecedores antes de se comprometer com um, em vez de verificar manualmente quatro páginas de preços separadas toda vez que avalia uma troca de modelo.
  • Você está executando uma lógica de fallback de vários fornecedores e deseja uma forma de solicitação/resposta consistente entre modelos do Google, Anthropic, OpenAI e DeepSeek em vez de manter quatro integrações de SDK separadas.

Leitura relacionada

FAQ

O gemini-3.5-flash é um ID de modelo válido que posso chamar diretamente no SDK do Google?

Não presuma isso. Confirme na lista de modelos atual do Google antes de implantar — as strings de ID de modelo mudam, e o status de visualização/GA muda com o tempo. Se você estiver roteando através do TokenLab, o gateway cuida desse mapeamento para você.

De onde vêm os preços dos concorrentes na tabela de comparação?

Eles são listagens do diretório do TokenLab. Apenas os preços de vídeo do Veo neste artigo remontam a uma fonte do Google com data independente (observada em 08/07/2026). Os preços do GPT-5.5, Claude Sonnet 5 e DeepSeek V4 Flash aqui não possuem citação independente fornecida — verifique com cada fornecedor antes de usar esses números em uma estimativa de custo voltada para o cliente.

Quão rápido é um loop de agente de 5 etapas do Gemini 3.5 Flash?

Nenhum valor de benchmark está incluído aqui porque nenhum foi obtido de forma independente para este artigo. Instrumente seu próprio loop (veja o exemplo de código acima) e meça a latência p50/p95 real em seu ambiente, em vez de confiar em um número de segunda mão.

O que acontece se o modelo que estou usando for depreciado no meio do projeto?

Este é exatamente o cenário que o desligamento do Veo 3.0 do Google (30 de junho de 2026) ilustra. Construa uma cadeia de fallback e, sempre que possível, roteie através de um gateway que mantenha slugs de modelo atualizados para que uma depreciação não exija uma reescrita de código.

Crie uma chave de API do TokenLab para comparar IDs de modelos atuais antes de implantar.

Fontes

Preço observado em 2026-07-08

← Voltar ao blog
Compartilhar:

Modelos relacionados

Modelos lançados recentemente

Crie com os modelos deste guia

Compare preços, teste rotas e transforme a pesquisa em uma chamada de API funcional.