Google: Gemini 3.5 Flash
gemini-3.5-flash- Entrada / Saída-50%
- $1.50 / $9.00$0.75 / $4.50
- Contexto
- 1M
- Lançado
- 19 de mai. de 2026
- Saída máxima
- 64K
- Modalidades
- VisãoChat
- Capacidades
- Uso de ferramentasCache de promptsRaciocínio
Sobre o Gemini 3.5 Flash
O Gemini 3.5 Flash é um modelo estável da categoria Flash do Google, descrito como a base para velocidade e desempenho fundamental em cargas de trabalho rotineiras de alto volume. Ele lê texto e imagens, chama ferramentas, retorna JSON vinculado a um esquema e oferece suporte a cache. Ele se posiciona entre o Flash-Lite 3.5 e os lançamentos posteriores Flash 3.6, 3.7 e 3.8.
Pontos fortes
- Um modelo Flash estável de uso geral para chat, extração e sumarização de rotina em grande volume.
- A chamada de ferramentas oferece suporte a assistentes que realizam uma tarefa em algumas etapas.
- A entrada de imagens permite lidar com capturas de tela, digitalizações e gráficos sem a necessidade de um modelo de visão separado.
- JSON vinculado a esquema e cache de contexto são adequados para chamadas de pipeline repetidas.
Quando usar outro modelo
- Os modelos Flash 3.6, 3.7 e 3.8, lançados posteriormente, são mais robustos em tarefas de codificação e agentes.
- Ele não possui um modo de pensamento dedicado, portanto, raciocínios complexos de várias etapas são mais bem executados em outro lugar.
Primeiros passos
Criar chave de API
Crie uma chave no Console e use com qualquer modelo da plataforma.
Envie sua primeira requisição
Copie o exemplo para sua linguagem e execute-o no endpoint.
Texto para textoGemini APIPOST/v1beta/models/gemini-3.5-flash:generateContentFormato da API:curl "https://api.tokenlab.sh/v1beta/models/gemini-3.5-flash:generateContent" \ -H "Content-Type: application/json" \ -H "x-goog-api-key: sk-xxx" \ -d '{ "contents": [ {"role": "user", "parts": [{"text": "Hello!"}]} ] }'
Preço
O preço Verified vale para o Verified, que custa menos na maioria dos modelos. O preço Official é o preço publicado pelo fabricante do modelo e vale para a rota Official, mais confiável. O Auto cobra pela rota que conclui a solicitação.
Especificação padrão
Por 1M Token- Preço Official
- Entrada $1.50 / Saída $9.00 / Leitura de cache $0.15
- Preço Verified
- Entrada $0.75 / Saída $4.50 / Leitura de cache $0.075
- Desconto
- -50%
Leitura de cache
- Preço Official
- $0.15
- Preço Verified
- $0.075
- Desconto
- -50%
Cobrado por chamada, apenas quando o modelo utiliza a ferramenta.
Pesquisa na web
- Preço Official
- $0.014/busca
- Preço Verified
- $0.007/busca
- Desconto
- -50%
| Preço OfficialPor 1M Token | Preço VerifiedPor 1M Token | Desconto | |
|---|---|---|---|
| Especificação padrão | Entrada $1.50 / Saída $9.00 / Leitura de cache $0.15 | Entrada $0.75 / Saída $4.50 / Leitura de cache $0.075 | -50% |
| Preços de cache de prompt | |||
| Leitura de cache | $0.15 | $0.075 | -50% |
| Taxas de ferramentasCobrado por chamada, apenas quando o modelo utiliza a ferramenta. | |||
| Pesquisa na web | $0.014/busca | $0.007/busca | -50% |
Uso e atividade
A taxa de sucesso é a proporção de requisições concluídas. A latência é quanto tempo uma resposta completa leva; P95 significa que 95% das requisições terminaram dentro desse tempo.
Uso e disponibilidade
Últimas 24 horas- Requisições
- Taxa de sucesso
- Latência P95
- Total de tokens
- Taxa de sucesso em 30 dias
- 95,0%
- Requisições em 30 dias
- 1K+
- Última atividade
- há 3 horas
Os dados baseiam-se em solicitações agregadas de usuários, excluindo verificações de status.
Abrir no Console
Abra Gemini 3.5 Flash no Console com um prompt pronto para editar ou enviar.
Ajude-me a testar gemini-3.5-flash com uma mensagem em /v1beta/models/gemini-3.5-flash:generateContent. Exiba a resposta, latência e custo.
Casos de uso
Indicado para- Raciocínio
- Visão
Chat voltado ao cliente
Responder a perguntas sobre produtos com uma base de conhecimento em cache no prefixo do prompt.
Sumarização em lote
Resumir transcrições de chamadas ou tickets e gerar um resumo em JSON fixo por item.
Leitura de formulários e documentos
Extrair campos de formulários digitalizados e notas de entrega para registros estruturados que um sistema subsequente possa carregar diretamente.
Ajuda em codificação de nível básico
Explicar código, escrever pequenas funções e redigir testes unitários onde a profundidade não é crítica.
Exemplos de prompt
Resuma esta transcrição de suporte em três tópicos e defina 'resolved' (resolvido) como verdadeiro ou falso.
Leia esta nota de entrega digitalizada e retorne o número do pedido, os itens e o status da assinatura como JSON.
Escreva uma função em Python que analise datas ISO a partir de strings desformatadas, além de cinco casos de teste.
Este modelo tem preço condicional. Totais mensais de tokens sozinhos não produzem uma estimativa confiável; use o preço detalhado para a especificação da requisição, cache e janela aplicável.
FAQ
O que é o Gemini 3.5 Flash?
Um modelo Gemini estável da categoria Flash voltado para tarefas rotineiras de alto volume. Ele aceita texto e imagens, usa ferramentas e produz saída estruturada, com foco em velocidade constante em vez de profundidade máxima.
Como ele se compara ao Gemini 3.5 Flash-Lite?
O Flash-Lite é o modelo 3.5 mais rápido e econômico do Google; o Flash é o modelo mais completo para tarefas que exigem mais cuidado. Escolha o Lite para marcação e extração, e o Flash para conversação e saídas mais longas.
Ele é bom para agentes de codificação?
Ele pode lidar com pequenas tarefas de codificação, mas os modelos Flash 3.7 e 3.8 do Google são os voltados para codificação complexa e agentes de longo prazo. Use o 3.5 Flash quando o trabalho for simples e o volume for alto.
Ele oferece suporte a imagens e cache?
Sim para ambos. Imagens podem ser incluídas junto ao texto em uma única solicitação, e o cache de contexto reutiliza um longo prefixo compartilhado em várias solicitações, como um conjunto fixo de instruções.
Quanto custa o Gemini 3.5 Flash?
No TokenLab, Gemini 3.5 Flash custa Entrada $0.75 / Saída $4.50 Por 1M Token. A tabela de preços acima mostra o detalhamento completo. As tarifas dependem da unidade de cobrança, da especificação e do uso. Compare condições iguais no preço detalhado do modelo; uma única tarifa não determina o custo total.
Qual a janela de contexto e o limite de saída do Gemini 3.5 Flash?
O Gemini 3.5 Flash aceita até 1.048.576 tokens de contexto e gera até 65.536 tokens por resposta.
Qual endpoint o Gemini 3.5 Flash deve usar?
Use https://api.tokenlab.sh/v1beta/models/gemini-3.5-flash:generateContent para Gemini 3.5 Flash. O exemplo de requisição abaixo mostra o formato de código correspondente.
Quais operações o Gemini 3.5 Flash suporta?
Gemini 3.5 Flash suporta Texto para texto. Selecione uma operação acima para ver seu endpoint e exemplo de requisição.
Comparar Gemini 3.5 Flash
Guias com Gemini 3.5 Flash
Fontes
Revisado em 2 de out. de 2026