Google: Gemini 3.1 Flash-Lite
gemini-3.1-flash-lite- Entrada / Saída-50%
- $0.25 / $1.50$0.125 / $0.75
- Contexto
- 1M
- Lançado
- 7 de mai. de 2026
- Saída máxima
- 64K
- Modalidades
- VisãoChat
- Capacidades
- Uso de ferramentasCache de prompts
Sobre o Gemini 3.1 Flash-Lite
O Gemini 3.1 Flash-Lite é o modelo de baixa latência e baixo custo do Google na linha Gemini 3.1, criado para cargas de trabalho multimodais e de agentes de alto volume. O Google descreve um desempenho de classe de fronteira que rivaliza com modelos maiores por uma fração do custo. Ele lê texto e imagens, chama ferramentas, retorna JSON vinculado a esquema e suporta cache de contexto, situando-se abaixo do nível Flash em capacidade.
Pontos fortes
- Tempos de resposta curtos o tornam adequado para recursos interativos onde cada chamada deve retornar rapidamente.
- Imagens e texto entram na mesma solicitação, o que é adequado para processamento de recibos, formulários e capturas de tela.
- A saída JSON vinculada a esquema elimina a necessidade de análise frágil de texto livre.
- A chamada de ferramentas e o suporte a cache de contexto permitem etapas de agente repetidas e semelhantes em escala.
Quando usar outro modelo
- Para agentes de codificação longos e com várias etapas, os modelos Flash e Pro se sustentam melhor do que um modelo Lite.
- Não é um modelo focado em raciocínio; matemática complexa ou planejamento profundo são melhor enviados ao Gemini 3.1 Pro.
Primeiros passos
Criar chave de API
Crie uma chave no Console e use com qualquer modelo da plataforma.
Envie sua primeira requisição
Copie o exemplo para sua linguagem e execute-o no endpoint.
Texto para textoGemini APIPOST/v1beta/models/gemini-3.1-flash-lite:generateContentFormato da API:curl "https://api.tokenlab.sh/v1beta/models/gemini-3.1-flash-lite:generateContent" \ -H "Content-Type: application/json" \ -H "x-goog-api-key: sk-xxx" \ -d '{ "contents": [ {"role": "user", "parts": [{"text": "Hello!"}]} ] }'
Preço
O preço Verified vale para o Verified, que custa menos na maioria dos modelos. O preço Official é o preço publicado pelo fabricante do modelo e vale para a rota Official, mais confiável. O Auto cobra pela rota que conclui a solicitação.
Especificação padrão
Por 1M Token- Preço Official
- Entrada $0.25 / Saída $1.50 / Leitura de cache $0.025
- Preço Verified
- Entrada $0.125 / Saída $0.75 / Leitura de cache $0.0125
- Desconto
- -50%
Leitura de cache
- Preço Official
- $0.025
- Preço Verified
- $0.0125
- Desconto
- -50%
Cobrado por chamada, apenas quando o modelo utiliza a ferramenta.
Pesquisa na web
- Preço Official
- $0.014/busca
- Preço Verified
- $0.007/busca
- Desconto
- -50%
| Preço OfficialPor 1M Token | Preço VerifiedPor 1M Token | Desconto | |
|---|---|---|---|
| Especificação padrão | Entrada $0.25 / Saída $1.50 / Leitura de cache $0.025 | Entrada $0.125 / Saída $0.75 / Leitura de cache $0.0125 | -50% |
| Preços de cache de prompt | |||
| Leitura de cache | $0.025 | $0.0125 | -50% |
| Taxas de ferramentasCobrado por chamada, apenas quando o modelo utiliza a ferramenta. | |||
| Pesquisa na web | $0.014/busca | $0.007/busca | -50% |
Uso e atividade
A taxa de sucesso é a proporção de requisições concluídas. A latência é quanto tempo uma resposta completa leva; P95 significa que 95% das requisições terminaram dentro desse tempo.
Uso e disponibilidade
Últimas 24 horas- Requisições
- Taxa de sucesso
- Latência P95
- Total de tokens
- Taxa de sucesso em 30 dias
- 100,0%
- Requisições em 30 dias
- 40K+
- Última atividade
- há 7 minutos
Os dados baseiam-se em solicitações agregadas de usuários, excluindo verificações de status.
Abrir no Console
Abra Gemini 3.1 Flash-Lite no Console com um prompt pronto para editar ou enviar.
Ajude-me a testar gemini-3.1-flash-lite com uma mensagem em /v1beta/models/gemini-3.1-flash-lite:generateContent. Exiba a resposta, latência e custo.
Casos de uso
Indicado para- Visão
Extração em massa
Extraia campos de milhares de faturas ou formulários e escreva cada resultado como um objeto JSON validado.
Moderação e marcação de conteúdo
Rotule envios e comentários de usuários em relação a uma política fixa com uma justificativa de uma linha.
Camada de roteamento
Decida para qual modelo especialista ou ferramenta uma solicitação deve ir e, em seguida, encaminhe-a.
Assistentes em tempo real
Potencialize o preenchimento automático, respostas rápidas ou turnos de assistente de voz onde uma espera visível prejudicaria a experiência da pessoa que o utiliza.
Exemplos de prompt
Extraia o fornecedor, data, total e moeda desta imagem de fatura e retorne-os como JSON.
Marque o comentário abaixo como spam, abuso, pergunta ou elogio e explique a escolha em uma frase.
Dada esta mensagem do usuário, escolha uma das opções: search_docs, create_ticket, answer_directly. Responda apenas com o nome da ferramenta.
Este modelo tem preço condicional. Totais mensais de tokens sozinhos não produzem uma estimativa confiável; use o preço detalhado para a especificação da requisição, cache e janela aplicável.
FAQ
Para que o Gemini 3.1 Flash-Lite é melhor?
Trabalhos de alto volume e sensíveis à latência, como extração, classificação, marcação, roteamento e respostas multimodais rápidas. Ele troca um pouco da profundidade de raciocínio por velocidade e uma carga mais leve por chamada.
Ele aceita imagens?
Sim. Texto e imagens podem ser misturados em uma única solicitação, permitindo que ele leia documentos, capturas de tela e fotos. Sua resposta retorna como texto ou como JSON que corresponde ao seu esquema.
Ele pode chamar ferramentas?
Sim. A chamada de função é suportada, o que permite que ele atue como o agente de primeiro estágio que escolhe ferramentas para solicitações simples ou encaminha casos difíceis para um modelo maior.
Como ele é diferente do Gemini 3.5 Flash-Lite?
O 3.5 Flash-Lite é a geração mais recente e a que o Google agora indica para novos projetos; o 3.1 Flash-Lite é o modelo Lite mais antigo, ainda estável. Teste seus próprios prompts em ambos antes de mover o tráfego.
Quanto custa o Gemini 3.1 Flash-Lite?
No TokenLab, Gemini 3.1 Flash-Lite custa Entrada $0.125 / Saída $0.75 Por 1M Token. A tabela de preços acima mostra o detalhamento completo. As tarifas dependem da unidade de cobrança, da especificação e do uso. Compare condições iguais no preço detalhado do modelo; uma única tarifa não determina o custo total.
Qual a janela de contexto e o limite de saída do Gemini 3.1 Flash-Lite?
O Gemini 3.1 Flash-Lite aceita até 1.048.576 tokens de contexto e gera até 65.536 tokens por resposta.
Qual endpoint o Gemini 3.1 Flash-Lite deve usar?
Use https://api.tokenlab.sh/v1beta/models/gemini-3.1-flash-lite:generateContent para Gemini 3.1 Flash-Lite. O exemplo de requisição abaixo mostra o formato de código correspondente.
Quais operações o Gemini 3.1 Flash-Lite suporta?
Gemini 3.1 Flash-Lite suporta Texto para texto. Selecione uma operação acima para ver seu endpoint e exemplo de requisição.
Comparar Gemini 3.1 Flash-Lite
Guias com Gemini 3.1 Flash-Lite
Fontes
Revisado em 2 de out. de 2026