Escolha Auto, TokenLab Verified ou Official para cada solicitação, com preços exibidos antecipadamente.Veja as novidades

xAI: Grok Voice Think Fast 2.0

O Grok Voice Think Fast 2.0 é um modelo de voz para conversação ao vivo. É um candidato para interfaces faladas nas quais o assistente deve acompanhar uma troca em andamento em vez de simplesmente ler um roteiro preparado.
Comparar modelos
grok-voice-think-fast-2.0
DisponívelxAIÁudioSíncrono
Preço
A partir de $0.001333
Modalidades
Áudio

Sobre o Grok Voice Think Fast 2.0

Grok Voice Think Fast 2.0 é o modelo de voz em tempo real da xAI para conversas viva-voz bidirecionais, criado para assistentes que precisam acompanhar o ritmo de um locutor em vez de ler um roteiro preparado. É a versão de modelo por trás do alias grok-voice-latest. Use este ID exato quando um produto precisar de uma versão de modelo fixa para suas respostas faladas.

Pontos fortes

  • É a versão fixa e numerada por trás do alias de agente de voz da xAI, para que o comportamento permaneça vinculado a um modelo até que você mude para outro.
  • A detecção de atividade de voz no lado do servidor gerencia a alternância de turnos, permitindo que o cliente faça streaming do áudio do microfone sem precisar de sua própria lógica de pausa.
  • As instruções por resposta permitem que uma sessão altere o prompt do sistema para uma única resposta, por exemplo, para mudar o tom em uma explicação sobre reembolso.
  • As substituições de pronúncia corrigem a forma como nomes e termos de produtos são falados sem alterar a transcrição.

Quando usar outro modelo

  • É um modelo conversacional de fala para fala (speech-to-speech), portanto, transcrições em lote de arquivos e narrações de textos longos são mais bem atendidas pelos modelos de fala dedicados.
  • Manter uma conexão aberta para áudio ao vivo exige um cliente WebSocket; uma chamada simples de solicitação e resposta não será suficiente.

Primeiros passos

  1. Criar chave de API

    Crie uma chave no Console e use com qualquer modelo da plataforma.

  2. Envie sua primeira requisição

    Copie o exemplo para sua linguagem e execute-o no endpoint.

    ÁudioChat Completions API
    POST/v1/chat/completions
    curl https://api.tokenlab.sh/v1/chat/completions \
      -H "Content-Type: application/json" \
      -H "Authorization: Bearer sk-xxx" \
      -d '{
        "model": "grok-voice-think-fast-2.0",
        "messages": [
          {"role": "user", "content": "Hello!"}
        ]
      }'

Preço

O preço oficial é a base pública do criador do modelo. O preço TokenLab é o que você paga por este modelo na TokenLab.

Audio Duration

por segundo
Preço oficial
$0.001333
Official
$0.001333
Desconto
—

Uso e atividade

A taxa de sucesso é a proporção de requisições concluídas. A latência é quanto tempo uma resposta completa leva; P95 significa que 95% das requisições terminaram dentro desse tempo.

Uso e disponibilidade

Últimas 24 horas
Requisições
Taxa de sucesso
Latência P95
Total de tokens
Desempenho do modelo
As métricas aparecerão assim que os limites de privacidade e volume de dados forem atingidos.

Os dados baseiam-se em solicitações agregadas de usuários, excluindo verificações de status.

Casos de uso

  • Substituição de URA (Unidade de Resposta Audível)

    Substitua árvores telefônicas baseadas em menus por um atendente para o qual o chamador simplesmente relata o problema, enquanto o agente transfere a chamada ou a resolve.

  • Parceiro de prática de idiomas

    Mantenha um diálogo falado em um idioma de destino, corrigindo erros em voz alta e ajustando a velocidade quando o aluno solicitar.

  • Assistente de campo sem uso das mãos

    Permita que um técnico faça perguntas sobre um manual por voz e ouça as respostas enquanto mantém ambas as mãos no equipamento.

Exemplos de prompt

Você é um agente de suporte calmo de um provedor de internet. Peça o CEP da conta e, em seguida, guie o chamador pelo processo de reinicialização do roteador.

Pronuncie nossa marca 'Zyntra' como ZIN-tra, mantenha um tom amigável e nunca interrompa o chamador no meio da frase.

Aja como um tutor de português. Fale devagar, repita minha frase corrigida e faça uma pergunta de acompanhamento a cada turno.

FAQ

Qual é a diferença entre grok-voice-think-fast-2.0 e grok-voice-latest?

grok-voice-think-fast-2.0 é uma versão específica de modelo, enquanto grok-voice-latest é um alias que atualmente aponta para ela. O alias será direcionado a lançamentos mais recentes; o nome com data permanece na versão que você testou.

O Grok Voice Think Fast 2.0 é um modelo de conversão de texto em fala (text-to-speech)?

Não. Ele ouve e responde em uma sessão ao vivo, recebendo áudio e produzindo respostas faladas. Para transformar texto preparado em áudio, use o Grok Voice TTS; para transcrever gravações, use o Grok Voice STT.

Como ele decide quando terminei de falar?

As sessões podem ativar a detecção de atividade de voz no lado do servidor, que identifica o fim do turno do usuário e inicia a resposta. Você também pode gerenciar os turnos por conta própria se o seu cliente já contar com o recurso de apertar para falar (push-to-talk).

Quais vozes ele pode usar?

Uma sessão pode escolher entre as vozes integradas da xAI, com eve como padrão, ou uma voz personalizada clonada a partir de uma gravação de referência curta. As vozes integradas falam todos os idiomas suportados.

Quanto custa o Grok Voice Think Fast 2.0?

No TokenLab, Grok Voice Think Fast 2.0 custa $0.001333 por segundo. A tabela de preços acima mostra o detalhamento completo. As tarifas dependem da unidade de cobrança, da especificação e do uso. Compare condições iguais no preço detalhado do modelo; uma única tarifa não determina o custo total.

Qual endpoint o Grok Voice Think Fast 2.0 deve usar?

Use https://api.tokenlab.sh/v1/chat/completions para Grok Voice Think Fast 2.0. O exemplo de requisição abaixo mostra o formato de código correspondente.

Comparar Grok Voice Think Fast 2.0

Fontes

Revisado em 2 de out. de 2026

Mais da série Grok Voice

Modelos relacionados