Escolha Auto, TokenLab Verified ou Official para cada solicitação, com preços exibidos antecipadamente.Veja as novidades

Google: Gemini 3.5 Flash

O Gemini 3.5 Flash foi criado para codificação sustentada e trabalho agentico. Seu longo contexto e capacidade de chamada de ferramentas são adequados para assistentes que precisam conduzir uma tarefa por várias etapas, mantendo documentos, código e decisões anteriores.
Comparar modelos
gemini-3.5-flash
DisponívelGoogleChatEntrada em cache 90% mais barata
Entrada / Saída-50%
$1.50 / $9.00$0.75 / $4.50
Contexto
1M
Lançado
19 de mai. de 2026
Saída máxima
64K
Modalidades
VisãoChat
Capacidades
Uso de ferramentasCache de promptsRaciocínio

Sobre o Gemini 3.5 Flash

O Gemini 3.5 Flash é um modelo estável da categoria Flash do Google, descrito como a base para velocidade e desempenho fundamental em cargas de trabalho rotineiras de alto volume. Ele lê texto e imagens, chama ferramentas, retorna JSON vinculado a um esquema e oferece suporte a cache. Ele se posiciona entre o Flash-Lite 3.5 e os lançamentos posteriores Flash 3.6, 3.7 e 3.8.

Pontos fortes

  • Um modelo Flash estável de uso geral para chat, extração e sumarização de rotina em grande volume.
  • A chamada de ferramentas oferece suporte a assistentes que realizam uma tarefa em algumas etapas.
  • A entrada de imagens permite lidar com capturas de tela, digitalizações e gráficos sem a necessidade de um modelo de visão separado.
  • JSON vinculado a esquema e cache de contexto são adequados para chamadas de pipeline repetidas.

Quando usar outro modelo

  • Os modelos Flash 3.6, 3.7 e 3.8, lançados posteriormente, são mais robustos em tarefas de codificação e agentes.
  • Ele não possui um modo de pensamento dedicado, portanto, raciocínios complexos de várias etapas são mais bem executados em outro lugar.

Primeiros passos

  1. Criar chave de API

    Crie uma chave no Console e use com qualquer modelo da plataforma.

  2. Envie sua primeira requisição

    Copie o exemplo para sua linguagem e execute-o no endpoint.

    Texto para textoGemini API
    POST/v1beta/models/gemini-3.5-flash:generateContent
    Formato da API:
    curl "https://api.tokenlab.sh/v1beta/models/gemini-3.5-flash:generateContent" \
      -H "Content-Type: application/json" \
      -H "x-goog-api-key: sk-xxx" \
      -d '{
        "contents": [
          {"role": "user", "parts": [{"text": "Hello!"}]}
        ]
      }'

Preço

O preço Verified vale para o Verified, que custa menos na maioria dos modelos. O preço Official é o preço publicado pelo fabricante do modelo e vale para a rota Official, mais confiável. O Auto cobra pela rota que conclui a solicitação.

Especificação padrão

Por 1M Token
Preço Official
Entrada $1.50 / Saída $9.00 / Leitura de cache $0.15
Preço Verified
Entrada $0.75 / Saída $4.50 / Leitura de cache $0.075
Desconto
-50%
Preços de cache de prompt

Leitura de cache

Preço Official
$0.15
Preço Verified
$0.075
Desconto
-50%
Taxas de ferramentas

Cobrado por chamada, apenas quando o modelo utiliza a ferramenta.

Pesquisa na web

Preço Official
$0.014/busca
Preço Verified
$0.007/busca
Desconto
-50%

Uso e atividade

A taxa de sucesso é a proporção de requisições concluídas. A latência é quanto tempo uma resposta completa leva; P95 significa que 95% das requisições terminaram dentro desse tempo.

Uso e disponibilidade

Últimas 24 horas
Requisições
Taxa de sucesso
Latência P95
Total de tokens
Desempenho do modelo
Taxa de sucesso em 30 dias
95,0%
Requisições em 30 dias
1K+
Última atividade
há 3 horas

Os dados baseiam-se em solicitações agregadas de usuários, excluindo verificações de status.

Abrir no Console

Abra Gemini 3.5 Flash no Console com um prompt pronto para editar ou enviar.

Ajude-me a testar gemini-3.5-flash com uma mensagem em /v1beta/models/gemini-3.5-flash:generateContent. Exiba a resposta, latência e custo.

Casos de uso

Indicado para
  • Raciocínio
  • Visão
  • Chat voltado ao cliente

    Responder a perguntas sobre produtos com uma base de conhecimento em cache no prefixo do prompt.

  • Sumarização em lote

    Resumir transcrições de chamadas ou tickets e gerar um resumo em JSON fixo por item.

  • Leitura de formulários e documentos

    Extrair campos de formulários digitalizados e notas de entrega para registros estruturados que um sistema subsequente possa carregar diretamente.

  • Ajuda em codificação de nível básico

    Explicar código, escrever pequenas funções e redigir testes unitários onde a profundidade não é crítica.

Exemplos de prompt

Resuma esta transcrição de suporte em três tópicos e defina 'resolved' (resolvido) como verdadeiro ou falso.

Leia esta nota de entrega digitalizada e retorne o número do pedido, os itens e o status da assinatura como JSON.

Escreva uma função em Python que analise datas ISO a partir de strings desformatadas, além de cinco casos de teste.

Este modelo tem preço condicional. Totais mensais de tokens sozinhos não produzem uma estimativa confiável; use o preço detalhado para a especificação da requisição, cache e janela aplicável.

FAQ

O que é o Gemini 3.5 Flash?

Um modelo Gemini estável da categoria Flash voltado para tarefas rotineiras de alto volume. Ele aceita texto e imagens, usa ferramentas e produz saída estruturada, com foco em velocidade constante em vez de profundidade máxima.

Como ele se compara ao Gemini 3.5 Flash-Lite?

O Flash-Lite é o modelo 3.5 mais rápido e econômico do Google; o Flash é o modelo mais completo para tarefas que exigem mais cuidado. Escolha o Lite para marcação e extração, e o Flash para conversação e saídas mais longas.

Ele é bom para agentes de codificação?

Ele pode lidar com pequenas tarefas de codificação, mas os modelos Flash 3.7 e 3.8 do Google são os voltados para codificação complexa e agentes de longo prazo. Use o 3.5 Flash quando o trabalho for simples e o volume for alto.

Ele oferece suporte a imagens e cache?

Sim para ambos. Imagens podem ser incluídas junto ao texto em uma única solicitação, e o cache de contexto reutiliza um longo prefixo compartilhado em várias solicitações, como um conjunto fixo de instruções.

Quanto custa o Gemini 3.5 Flash?

No TokenLab, Gemini 3.5 Flash custa Entrada $0.75 / Saída $4.50 Por 1M Token. A tabela de preços acima mostra o detalhamento completo. As tarifas dependem da unidade de cobrança, da especificação e do uso. Compare condições iguais no preço detalhado do modelo; uma única tarifa não determina o custo total.

Qual a janela de contexto e o limite de saída do Gemini 3.5 Flash?

O Gemini 3.5 Flash aceita até 1.048.576 tokens de contexto e gera até 65.536 tokens por resposta.

Qual endpoint o Gemini 3.5 Flash deve usar?

Use https://api.tokenlab.sh/v1beta/models/gemini-3.5-flash:generateContent para Gemini 3.5 Flash. O exemplo de requisição abaixo mostra o formato de código correspondente.

Quais operações o Gemini 3.5 Flash suporta?

Gemini 3.5 Flash suporta Texto para texto. Selecione uma operação acima para ver seu endpoint e exemplo de requisição.

Comparar Gemini 3.5 Flash

Guias com Gemini 3.5 Flash

Fontes

Revisado em 2 de out. de 2026

Mais da série Gemini 3

Modelos relacionados