Google: Gemma 4 31B
gemma-4-31b- Entrada / Saída
- $0.102 / $0.297
- Modalidades
- Chat
Sobre o Gemma 4 31B
O Gemma 4 31B é o maior modelo denso da família Gemma 4 de pesos abertos do Google, lançada em março de 2026 em tamanhos que variam de E2B a 31B. O Google descreve a família como sendo criada para raciocínio, fluxos de trabalho agenticos, codificação e compreensão multimodal. Ao contrário dos modelos proprietários Gemini, seus pesos são publicados, permitindo que o mesmo modelo seja executado em seu próprio hardware.
Pontos fortes
- Pesos abertos permitem que você mova o mesmo modelo entre configurações hospedadas e autoexecutadas.
- O tamanho denso de 31B foca na qualidade de raciocínio e codificação que os tamanhos menores do Gemma 4 não oferecem.
- O cartão do modelo do Google relata resultados sólidos em benchmarks de raciocínio e codificação, como o MMLU Pro e o LiveCodeBench v6.
- Cobertura multilíngue em mais de 140 idiomas.
Quando usar outro modelo
- Ele funciona apenas com texto e não possui chamada de ferramentas, portanto, fluxos de trabalho de agentes são melhor atendidos por um modelo Gemini.
- Ele é menos capaz do que os modelos Gemini 3.x Pro e Flash em tarefas autônomas longas.
Primeiros passos
Criar chave de API
Crie uma chave no Console e use com qualquer modelo da plataforma.
Envie sua primeira requisição
Copie o exemplo para sua linguagem e execute-o no endpoint.
Texto para textoChat Completions APIPOST/v1/chat/completionscurl https://api.tokenlab.sh/v1/chat/completions \ -H "Content-Type: application/json" \ -H "Authorization: Bearer sk-xxx" \ -d '{ "model": "gemma-4-31b", "messages": [ {"role": "user", "content": "Hello!"} ] }'
Preço
O preço oficial é a base pública do criador do modelo. O preço TokenLab é o que você paga por este modelo na TokenLab.
Especificação padrão
Por 1M Token- Preço oficial
- Entrada $0.102 / Saída $0.297 / Leitura de cache $0.012
- Official
- Entrada $0.102 / Saída $0.297 / Leitura de cache $0.012
- Desconto
- —
Leitura de cache
- Preço oficial
- $0.012
- Official
- $0.012
- Desconto
- —
| Preço oficialPor 1M Token | OfficialPor 1M Token | Desconto | |
|---|---|---|---|
| Especificação padrão | Entrada $0.102 / Saída $0.297 / Leitura de cache $0.012 | Entrada $0.102 / Saída $0.297 / Leitura de cache $0.012 | — |
| Preços de cache de prompt | |||
| Leitura de cache | $0.012 | $0.012 | — |
Uso e atividade
A taxa de sucesso é a proporção de requisições concluídas. A latência é quanto tempo uma resposta completa leva; P95 significa que 95% das requisições terminaram dentro desse tempo.
Uso e disponibilidade
Últimas 24 horas- Requisições
- Taxa de sucesso
- Latência P95
- Total de tokens
Os dados baseiam-se em solicitações agregadas de usuários, excluindo verificações de status.
Abrir no Console
Abra Gemma 4 31B no Console com um prompt pronto para editar ou enviar.
Ajude-me a testar gemma-4-31b com uma mensagem em /v1/chat/completions. Exiba a resposta, latência e custo.
Casos de uso
Assistente auto-hospedável
Crie protótipos com o modelo hospedado e, em seguida, migre para suas próprias GPUs se as regras de dados exigirem.
Chat multilíngue
Responda a usuários em muitos idiomas a partir de um único modelo, o que mantém as ferramentas de suporte mais simples do que executar tradutores separados.
Explicação de código
Revise trechos e escreva funções em ambientes onde um modelo de pesos abertos é um requisito por motivos de política ou hospedagem.
Base para ajuste fino (fine-tuning)
Compare uma linha de base hospedada antes de adaptar os pesos abertos ao seu domínio.
Exemplos de prompt
Traduza este parágrafo para espanhol, alemão e japonês e anote qualquer expressão idiomática que você teve que reformular.
Explique o que esta consulta SQL faz e, em seguida, reescreva-a para evitar a subconsulta correlacionada.
Escreva uma resposta curta e educada recusando este pedido de reunião e propondo a próxima semana.
Este modelo tem preço condicional. Totais mensais de tokens sozinhos não produzem uma estimativa confiável; use o preço detalhado para a especificação da requisição, cache e janela aplicável.
FAQ
O Gemma 4 31B é código aberto (open source)?
O Google publica os pesos sob os termos do Gemma, o que o torna de pesos abertos. Leia a licença no cartão do modelo antes do uso comercial, pois é a licença própria do Gemma.
Como o Gemma é diferente do Gemini?
Os modelos Gemini são a linha proprietária hospedada do Google. Os modelos Gemma são modelos menores de pesos abertos criados a partir de pesquisas relacionadas, que você pode baixar, ajustar e executar por conta própria.
Ele suporta chamada de ferramentas?
Não. O modelo hospedado lida apenas com chat de texto, com entrada e saída de texto e sem chamada de ferramentas. Para agentes que chamam funções, use um modelo Gemini.
Qual é o tamanho do modelo?
Cerca de 31 bilhões de parâmetros, denso, o maior dos cinco tamanhos do Gemma 4: E2B, E4B, 12B, 26B, A4B e 31B. Tamanhos menores são voltados para celulares e laptops.
Quanto custa o Gemma 4 31B?
No TokenLab, Gemma 4 31B custa Entrada $0.102 / Saída $0.297 Por 1M Token. A tabela de preços acima mostra o detalhamento completo. As tarifas dependem da unidade de cobrança, da especificação e do uso. Compare condições iguais no preço detalhado do modelo; uma única tarifa não determina o custo total.
Qual endpoint o Gemma 4 31B deve usar?
Use https://api.tokenlab.sh/v1/chat/completions para Gemma 4 31B. O exemplo de requisição abaixo mostra o formato de código correspondente.
Quais operações o Gemma 4 31B suporta?
Gemma 4 31B suporta Texto para texto. Selecione uma operação acima para ver seu endpoint e exemplo de requisição.
Comparar Gemma 4 31B
Fontes
Revisado em 2 de out. de 2026