Escolha Auto, TokenLab Verified ou Official para cada solicitação, com preços exibidos antecipadamente.Veja as novidades

xAI: Grok 4.20

O Grok 4.20 combina raciocínio, entrada visual e uso de ferramentas em uma conversa de contexto longo. É útil para investigações que reúnem textos extensos, imagens e resultados intermediários antes de chegar a uma resposta.
Comparar modelos
grok-4.20
DisponívelxAIChatEntrada em cache 84% mais barata
Entrada / Saída-50%
$1.25 / $2.50$0.625 / $1.25
Contexto
1M
Saída máxima
128K
Modalidades
VisãoChat
Capacidades
Uso de ferramentasCache de promptsRaciocínio

Sobre o Grok 4.20

O Grok 4.20 é o modelo com capacidade de raciocínio da xAI na família 4.20, criado para fluxos de trabalho de chamada de ferramentas com entradas muito longas. Ele lê texto e imagens e escreve texto, e pensa antes de responder, o que o diferencia dos modelos irmãos sem raciocínio e multiagentes que compartilham o nome da família. Escolha-o quando uma resposta depender de combinar muitos documentos, capturas de tela e resultados intermediários de ferramentas.

Pontos fortes

  • Raciocina sobre um problema antes de responder, para que perguntas de várias etapas recebam respostas trabalhadas em vez de um primeiro palpite.
  • Aceita imagens junto com texto, o que permite que uma conversa misture capturas de tela, gráficos e material escrito.
  • Chama ferramentas e retorna JSON estruturado, para que possa ser integrado a um loop de agente ou a um pipeline de extração.
  • Lida com um histórico de conversa muito longo, útil para investigações que acumulam evidências ao longo de muitas interações.
  • O cache de prompt reduz o custo de reenviar um prefixo compartilhado grande entre as solicitações.

Quando usar outro modelo

  • A etapa de raciocínio adiciona atraso; a variante 4.20 sem raciocínio responde mais rápido quando a tarefa é apenas redação ou extração.
  • Versões mais recentes do Grok, como a 4.7, focam mais diretamente em codificação e trabalho de agentes, podendo ter um desempenho melhor em tarefas de software difíceis.
  • A saída é apenas texto, portanto, não pode produzir imagens, áudio ou vídeo.

Primeiros passos

  1. Criar chave de API

    Crie uma chave no Console e use com qualquer modelo da plataforma.

  2. Envie sua primeira requisição

    Copie o exemplo para sua linguagem e execute-o no endpoint.

    Texto para textoResponses API
    POST/v1/responses
    Formato da API:
    curl https://api.tokenlab.sh/v1/responses \
      -H "Content-Type: application/json" \
      -H "Authorization: Bearer sk-xxx" \
      -d '{
        "model": "grok-4.20",
        "input": "Hello!"
      }'

Preço

O preço oficial é a base pública do criador do modelo. O preço TokenLab é o que você paga por este modelo na TokenLab.

Entrada tokens <= 200K

Por 1M Token
Preço oficial
Entrada $1.25 / Saída $2.50 / Leitura de cache $0.20
Preço da TokenLab
Entrada $0.625 / Saída $1.25 / Leitura de cache $0.10
Desconto
-50%

Entrada tokens > 200K

Por 1M Token
Preço oficial
Entrada $2.50 / Saída $5.00 / Leitura de cache $0.40
Preço da TokenLab
Entrada $1.25 / Saída $2.50 / Leitura de cache $0.20
Desconto
-50%
Preços de cache de prompt

Leitura de cache

Preço oficial
$0.20
Preço da TokenLab
$0.10
Desconto
-50%

Uso e atividade

A taxa de sucesso é a proporção de requisições concluídas. A latência é quanto tempo uma resposta completa leva; P95 significa que 95% das requisições terminaram dentro desse tempo.

Uso e disponibilidade

Últimas 24 horas
Requisições
Taxa de sucesso
Latência P95
Total de tokens
Desempenho do modelo
As métricas aparecerão assim que os limites de privacidade e volume de dados forem atingidos.

Os dados baseiam-se em solicitações agregadas de usuários, excluindo verificações de status.

Abrir no Console

Abra Grok 4.20 no Console com um prompt pronto para editar ou enviar.

Ajude-me a testar grok-4.20 com uma mensagem em /v1/responses. Exiba a resposta, latência e custo.

Casos de uso

Indicado para
  • Raciocínio
  • Visão
  • Investigações baseadas em evidências

    Forneça relatórios, exportações e capturas de tela coletadas durante um incidente ou auditoria, e peça uma linha do tempo fundamentada, além das perguntas pendentes.

  • Loops de agentes com ferramentas

    Dê a ele funções de pesquisa, banco de dados ou emissão de tickets e deixe que ele decida quais chamar, leia os resultados e continue até que a pergunta seja respondida.

  • Extração estruturada de entradas desorganizadas

    Transforme formulários digitalizados, faturas ou registros de chat em um esquema JSON fixo, com a etapa de raciocínio ajudando em entradas ambíguas.

Exemplos de prompt

Três exportações de log e uma captura de tela do painel seguem abaixo. Crie uma linha do tempo da interrupção e sinalize qualquer coisa que os logs contradigam.

Extraia o fornecedor, a data, os itens de linha e o imposto desta imagem de fatura como JSON correspondente ao esquema abaixo. Marque qualquer campo sobre o qual você não tenha certeza.

Você pode chamar search_orders e get_customer. Um cliente diz que dois itens estão faltando no pedido 8812. Descubra o que verificar e em que ordem.

Este modelo tem preço condicional. Totais mensais de tokens sozinhos não produzem uma estimativa confiável; use o preço detalhado para a especificação da requisição, cache e janela aplicável.

FAQ

O que é o Grok 4.20?

O Grok 4.20 é um modelo de chat da xAI que aceita texto e imagens e responde em texto. Esta é a versão de raciocínio da família: ele trabalha em um problema antes de responder. A xAI oferece a mesma geração em formas sem raciocínio e multiagentes.

Como o grok-4.20 difere do grok-4.20-non-reasoning?

O ID base gasta tempo raciocinando antes de responder, enquanto o ID sem raciocínio responde diretamente. Use o ID base para perguntas que precisam de várias etapas de análise, e o sem raciocínio para redação, extração e chat onde a velocidade importa mais do que a profundidade.

O Grok 4.20 consegue ler imagens?

Sim. Você pode enviar imagens com seu texto, por exemplo, capturas de tela, gráficos ou documentos fotografados, e fazer perguntas sobre eles na mesma conversa. As respostas são em texto; o modelo não gera nem edita imagens.

O Grok 4.20 suporta chamada de ferramentas e saída JSON?

Sim. Ele suporta chamada de função e respostas JSON estruturadas, para que você possa conectá-lo às suas próprias funções ou forçar uma resposta em um esquema. Isso o torna utilizável para trabalhos de extração e para agentes que atuam em sistemas externos.

Posso usar meu cliente estilo OpenAI existente com o Grok 4.20?

Sim. O código do cliente estilo OpenAI existente funciona alterando o nome do modelo, e as definições de ferramentas e esquemas JSON usam os mesmos campos que você já envia hoje.

Quanto custa o Grok 4.20?

No TokenLab, Grok 4.20 custa Entrada $0.625 / Saída $1.25 Por 1M Token. A tabela de preços acima mostra o detalhamento completo. As tarifas dependem da unidade de cobrança, da especificação e do uso. Compare condições iguais no preço detalhado do modelo; uma única tarifa não determina o custo total.

Qual a janela de contexto e o limite de saída do Grok 4.20?

O Grok 4.20 aceita até 1.000.000 tokens de contexto e gera até 131.072 tokens por resposta.

Qual endpoint o Grok 4.20 deve usar?

Use https://api.tokenlab.sh/v1/responses para Grok 4.20. O exemplo de requisição abaixo mostra o formato de código correspondente.

Quais operações o Grok 4.20 suporta?

Grok 4.20 suporta Texto para texto. Selecione uma operação acima para ver seu endpoint e exemplo de requisição.

Comparar Grok 4.20

Fontes

Revisado em 2 de out. de 2026

Mais da série Grok 4

Modelos relacionados