Escolha Auto, TokenLab Verified ou Official para cada solicitação, com preços exibidos antecipadamente.Veja as novidades

Google: Gemma 4 31B

O Gemma 4 31B é o modelo de pesos abertos denso do Google para conversação em texto, codificação e tarefas multilíngues. Este modelo do TokenLab expõe o contrato verificado de Chat Completions de texto.
Comparar modelos
gemma-4-31b
DisponívelGoogleChat
Entrada / Saída
$0.102 / $0.297
Modalidades
Chat

Sobre o Gemma 4 31B

O Gemma 4 31B é o maior modelo denso da família Gemma 4 de pesos abertos do Google, lançada em março de 2026 em tamanhos que variam de E2B a 31B. O Google descreve a família como sendo criada para raciocínio, fluxos de trabalho agenticos, codificação e compreensão multimodal. Ao contrário dos modelos proprietários Gemini, seus pesos são publicados, permitindo que o mesmo modelo seja executado em seu próprio hardware.

Pontos fortes

  • Pesos abertos permitem que você mova o mesmo modelo entre configurações hospedadas e autoexecutadas.
  • O tamanho denso de 31B foca na qualidade de raciocínio e codificação que os tamanhos menores do Gemma 4 não oferecem.
  • O cartão do modelo do Google relata resultados sólidos em benchmarks de raciocínio e codificação, como o MMLU Pro e o LiveCodeBench v6.
  • Cobertura multilíngue em mais de 140 idiomas.

Quando usar outro modelo

  • Ele funciona apenas com texto e não possui chamada de ferramentas, portanto, fluxos de trabalho de agentes são melhor atendidos por um modelo Gemini.
  • Ele é menos capaz do que os modelos Gemini 3.x Pro e Flash em tarefas autônomas longas.

Primeiros passos

  1. Criar chave de API

    Crie uma chave no Console e use com qualquer modelo da plataforma.

  2. Envie sua primeira requisição

    Copie o exemplo para sua linguagem e execute-o no endpoint.

    Texto para textoChat Completions API
    POST/v1/chat/completions
    curl https://api.tokenlab.sh/v1/chat/completions \
      -H "Content-Type: application/json" \
      -H "Authorization: Bearer sk-xxx" \
      -d '{
        "model": "gemma-4-31b",
        "messages": [
          {"role": "user", "content": "Hello!"}
        ]
      }'

Preço

O preço oficial é a base pública do criador do modelo. O preço TokenLab é o que você paga por este modelo na TokenLab.

Especificação padrão

Por 1M Token
Preço oficial
Entrada $0.102 / Saída $0.297 / Leitura de cache $0.012
Official
Entrada $0.102 / Saída $0.297 / Leitura de cache $0.012
Desconto
—
Preços de cache de prompt

Leitura de cache

Preço oficial
$0.012
Official
$0.012
Desconto
—

Uso e atividade

A taxa de sucesso é a proporção de requisições concluídas. A latência é quanto tempo uma resposta completa leva; P95 significa que 95% das requisições terminaram dentro desse tempo.

Uso e disponibilidade

Últimas 24 horas
Requisições
Taxa de sucesso
Latência P95
Total de tokens
Desempenho do modelo
As métricas aparecerão assim que os limites de privacidade e volume de dados forem atingidos.

Os dados baseiam-se em solicitações agregadas de usuários, excluindo verificações de status.

Abrir no Console

Abra Gemma 4 31B no Console com um prompt pronto para editar ou enviar.

Ajude-me a testar gemma-4-31b com uma mensagem em /v1/chat/completions. Exiba a resposta, latência e custo.

Casos de uso

  • Assistente auto-hospedável

    Crie protótipos com o modelo hospedado e, em seguida, migre para suas próprias GPUs se as regras de dados exigirem.

  • Chat multilíngue

    Responda a usuários em muitos idiomas a partir de um único modelo, o que mantém as ferramentas de suporte mais simples do que executar tradutores separados.

  • Explicação de código

    Revise trechos e escreva funções em ambientes onde um modelo de pesos abertos é um requisito por motivos de política ou hospedagem.

  • Base para ajuste fino (fine-tuning)

    Compare uma linha de base hospedada antes de adaptar os pesos abertos ao seu domínio.

Exemplos de prompt

Traduza este parágrafo para espanhol, alemão e japonês e anote qualquer expressão idiomática que você teve que reformular.

Explique o que esta consulta SQL faz e, em seguida, reescreva-a para evitar a subconsulta correlacionada.

Escreva uma resposta curta e educada recusando este pedido de reunião e propondo a próxima semana.

Este modelo tem preço condicional. Totais mensais de tokens sozinhos não produzem uma estimativa confiável; use o preço detalhado para a especificação da requisição, cache e janela aplicável.

FAQ

O Gemma 4 31B é código aberto (open source)?

O Google publica os pesos sob os termos do Gemma, o que o torna de pesos abertos. Leia a licença no cartão do modelo antes do uso comercial, pois é a licença própria do Gemma.

Como o Gemma é diferente do Gemini?

Os modelos Gemini são a linha proprietária hospedada do Google. Os modelos Gemma são modelos menores de pesos abertos criados a partir de pesquisas relacionadas, que você pode baixar, ajustar e executar por conta própria.

Ele suporta chamada de ferramentas?

Não. O modelo hospedado lida apenas com chat de texto, com entrada e saída de texto e sem chamada de ferramentas. Para agentes que chamam funções, use um modelo Gemini.

Qual é o tamanho do modelo?

Cerca de 31 bilhões de parâmetros, denso, o maior dos cinco tamanhos do Gemma 4: E2B, E4B, 12B, 26B, A4B e 31B. Tamanhos menores são voltados para celulares e laptops.

Quanto custa o Gemma 4 31B?

No TokenLab, Gemma 4 31B custa Entrada $0.102 / Saída $0.297 Por 1M Token. A tabela de preços acima mostra o detalhamento completo. As tarifas dependem da unidade de cobrança, da especificação e do uso. Compare condições iguais no preço detalhado do modelo; uma única tarifa não determina o custo total.

Qual endpoint o Gemma 4 31B deve usar?

Use https://api.tokenlab.sh/v1/chat/completions para Gemma 4 31B. O exemplo de requisição abaixo mostra o formato de código correspondente.

Quais operações o Gemma 4 31B suporta?

Gemma 4 31B suporta Texto para texto. Selecione uma operação acima para ver seu endpoint e exemplo de requisição.

Comparar Gemma 4 31B

Fontes

Revisado em 2 de out. de 2026

Modelos relacionados