Escolha Auto, TokenLab Verified ou Official para cada solicitação, com preços exibidos antecipadamente.Veja as novidades

Google: Gemini 3.5 Flash-Lite

O Gemini 3.5 Flash-Lite é voltado para trabalhos de alto volume com tempos de resposta curtos. Considere-o para processamento de documentos, extração e tarefas menores de agentes que são executadas repetidamente e precisam de um manuseio eficiente de entrada de texto e visual.
Comparar modelos
gemini-3.5-flash-lite
DisponívelGoogleChatEntrada em cache 90% mais barata
Entrada / Saída-50%
$0.30 / $2.50$0.15 / $1.25
Contexto
1M
Lançado
21 de jul. de 2026
Saída máxima
64K
Modalidades
VisãoChat
Capacidades
Uso de ferramentasCache de prompts

Sobre o Gemini 3.5 Flash-Lite

O Gemini 3.5 Flash-Lite é o modelo mais rápido e econômico do Google da geração 3.5, lançado em julho de 2026. Ele é voltado para trabalhos de alto volume onde tempos de resposta curtos são importantes: processamento de documentos, extração e pequenas tarefas repetidas de agentes. Ele lê texto e imagens, chama ferramentas, retorna JSON vinculado a esquema e faz cache de contexto, e o Google agora direciona novos projetos para ele.

Pontos fortes

  • Projetado para tempos de resposta curtos em trabalhos que se repetem milhares de vezes.
  • Lida com texto e imagens juntos para processamento de documentos e capturas de tela.
  • O JSON vinculado a esquema mantém a saída de extração consistente.
  • A chamada de função permite que ele execute pequenas etapas de agente, como consultas ou roteamento.

Quando usar outro modelo

  • Sessões longas de codificação e fluxos de trabalho corporativos complexos pertencem ao 3.8 Flash ou 3.1 Pro.
  • Ele perderá detalhes que um modelo Flash mais completo capturaria em documentos densos ou ambíguos.

Primeiros passos

  1. Criar chave de API

    Crie uma chave no Console e use com qualquer modelo da plataforma.

  2. Envie sua primeira requisição

    Copie o exemplo para sua linguagem e execute-o no endpoint.

    Texto para textoGemini API
    POST/v1beta/models/gemini-3.5-flash-lite:generateContent
    Formato da API:
    curl "https://api.tokenlab.sh/v1beta/models/gemini-3.5-flash-lite:generateContent" \
      -H "Content-Type: application/json" \
      -H "x-goog-api-key: sk-xxx" \
      -d '{
        "contents": [
          {"role": "user", "parts": [{"text": "Hello!"}]}
        ]
      }'

Preço

O preço TokenLab aplica-se ao Verified, que é mais barato na maioria dos modelos. O preço oficial segue a tabela do criador e aplica-se à rota Official, que é mais confiável. O modo Auto cobra pela rota que finalizar o seu pedido.

Especificação padrão

Por 1M Token
Preço oficial
Entrada $0.30 / Saída $2.50 / Leitura de cache $0.03
Preço da TokenLab
Entrada $0.15 / Saída $1.25 / Leitura de cache $0.015
Desconto
-50%
Preços de cache de prompt

Leitura de cache

Preço oficial
$0.03
Preço da TokenLab
$0.015
Desconto
-50%

Uso e atividade

A taxa de sucesso é a proporção de requisições concluídas. A latência é quanto tempo uma resposta completa leva; P95 significa que 95% das requisições terminaram dentro desse tempo.

Uso e disponibilidade

Últimas 24 horas
Requisições
Taxa de sucesso
Latência P95
Total de tokens
Desempenho do modelo
Taxa de sucesso em 30 dias
99,7%
Latência mediana em 7 dias
1,9 sn=346
Latência P95 em 7 dias
7 sn=346
Requisições em 30 dias
100+
Última atividade
há 19 horas

Os dados baseiam-se em solicitações agregadas de usuários, excluindo verificações de status.

Abrir no Console

Abra Gemini 3.5 Flash-Lite no Console com um prompt pronto para editar ou enviar.

Ajude-me a testar gemini-3.5-flash-lite com uma mensagem em /v1beta/models/gemini-3.5-flash-lite:generateContent. Exiba a resposta, latência e custo.

Casos de uso

Indicado para
  • Visão
  • Pipelines de documentos

    Converta contratos, faturas e relatórios em campos estruturados em escala, escrevendo um registro JSON validado para cada arquivo recebido.

  • Triagem de filas

    Classifique tickets ou mensagens recebidas por tópico e urgência antes que um humano ou um modelo maior os veja.

  • Pequenos agentes

    Execute trabalhos restritos em loop, como consultas de pedidos ou alterações de calendário, onde cada etapa é pequena e o loop se repete com frequência.

  • Verificações visuais

    Confirme se as fotos enviadas atendem a regras simples, como um rótulo visível ou orientação correta.

Exemplos de prompt

Extraia cada item desta fatura como JSON com descrição, quantidade e valor unitário.

Classifique a urgência deste ticket como baixa, média ou alta e forneça a frase única que a justifica.

Verifique se esta foto do produto mostra o rótulo da embalagem claramente; responda sim ou não e diga o porquê.

Este modelo tem preço condicional. Totais mensais de tokens sozinhos não produzem uma estimativa confiável; use o preço detalhado para a especificação da requisição, cache e janela aplicável.

FAQ

Para que serve o Gemini 3.5 Flash-Lite?

Trabalho rápido, repetido e simples: extração, classificação, roteamento e verificações multimodais leves. É a extremidade econômica da família 3.5, construída para tempo de resposta em vez de profundidade.

Ele é mais novo que o Gemini 3.1 Flash-Lite?

Sim. É a geração mais recente, e o Google o lista como a escolha leve recomendada para novos projetos. O 3.1 Flash-Lite mais antigo permanece disponível para integrações existentes.

Ele consegue ler imagens?

Sim, imagens podem acompanhar o texto em uma solicitação, e a resposta retorna como texto simples ou como JSON estruturado, o que é adequado para verificações de fotos e extração de documentos digitalizados.

Quando ele é pequeno demais?

Quando a tarefa exige raciocínio sustentado, análise cuidadosa de documentos longos ou trabalho de codificação de várias horas. Nesses casos, utilize o Gemini 3.8 Flash ou o 3.1 Pro.

Quanto custa o Gemini 3.5 Flash-Lite?

No TokenLab, Gemini 3.5 Flash-Lite custa Entrada $0.15 / Saída $1.25 Por 1M Token. A tabela de preços acima mostra o detalhamento completo. As tarifas dependem da unidade de cobrança, da especificação e do uso. Compare condições iguais no preço detalhado do modelo; uma única tarifa não determina o custo total.

Qual a janela de contexto e o limite de saída do Gemini 3.5 Flash-Lite?

O Gemini 3.5 Flash-Lite aceita até 1.048.576 tokens de contexto e gera até 65.536 tokens por resposta.

Qual endpoint o Gemini 3.5 Flash-Lite deve usar?

Use https://api.tokenlab.sh/v1beta/models/gemini-3.5-flash-lite:generateContent para Gemini 3.5 Flash-Lite. O exemplo de requisição abaixo mostra o formato de código correspondente.

Quais operações o Gemini 3.5 Flash-Lite suporta?

Gemini 3.5 Flash-Lite suporta Texto para texto. Selecione uma operação acima para ver seu endpoint e exemplo de requisição.

Comparar Gemini 3.5 Flash-Lite

Fontes

Revisado em 2 de out. de 2026

Mais da série Gemini 3

Modelos relacionados