xAI: Grok Voice Think Fast 2.0
grok-voice-think-fast-2.0- Preço
- A partir de $0.001333
- Modalidades
- Áudio
Sobre o Grok Voice Think Fast 2.0
Grok Voice Think Fast 2.0 é o modelo de voz em tempo real da xAI para conversas viva-voz bidirecionais, criado para assistentes que precisam acompanhar o ritmo de um locutor em vez de ler um roteiro preparado. É a versão de modelo por trás do alias grok-voice-latest. Use este ID exato quando um produto precisar de uma versão de modelo fixa para suas respostas faladas.
Pontos fortes
- É a versão fixa e numerada por trás do alias de agente de voz da xAI, para que o comportamento permaneça vinculado a um modelo até que você mude para outro.
- A detecção de atividade de voz no lado do servidor gerencia a alternância de turnos, permitindo que o cliente faça streaming do áudio do microfone sem precisar de sua própria lógica de pausa.
- As instruções por resposta permitem que uma sessão altere o prompt do sistema para uma única resposta, por exemplo, para mudar o tom em uma explicação sobre reembolso.
- As substituições de pronúncia corrigem a forma como nomes e termos de produtos são falados sem alterar a transcrição.
Quando usar outro modelo
- É um modelo conversacional de fala para fala (speech-to-speech), portanto, transcrições em lote de arquivos e narrações de textos longos são mais bem atendidas pelos modelos de fala dedicados.
- Manter uma conexão aberta para áudio ao vivo exige um cliente WebSocket; uma chamada simples de solicitação e resposta não será suficiente.
Primeiros passos
Criar chave de API
Crie uma chave no Console e use com qualquer modelo da plataforma.
Envie sua primeira requisição
Copie o exemplo para sua linguagem e execute-o no endpoint.
ÁudioChat Completions APIPOST/v1/chat/completionscurl https://api.tokenlab.sh/v1/chat/completions \ -H "Content-Type: application/json" \ -H "Authorization: Bearer sk-xxx" \ -d '{ "model": "grok-voice-think-fast-2.0", "messages": [ {"role": "user", "content": "Hello!"} ] }'
Preço
O preço oficial é a base pública do criador do modelo. O preço TokenLab é o que você paga por este modelo na TokenLab.
Audio Duration
por segundo- Preço oficial
- $0.001333
- Official
- $0.001333
- Desconto
- —
| Preço oficialpor segundo | Officialpor segundo | Desconto | |
|---|---|---|---|
| Audio Duration | $0.001333 | $0.001333 | — |
Uso e atividade
A taxa de sucesso é a proporção de requisições concluídas. A latência é quanto tempo uma resposta completa leva; P95 significa que 95% das requisições terminaram dentro desse tempo.
Uso e disponibilidade
Últimas 24 horas- Requisições
- Taxa de sucesso
- Latência P95
- Total de tokens
Os dados baseiam-se em solicitações agregadas de usuários, excluindo verificações de status.
Casos de uso
Substituição de URA (Unidade de Resposta Audível)
Substitua árvores telefônicas baseadas em menus por um atendente para o qual o chamador simplesmente relata o problema, enquanto o agente transfere a chamada ou a resolve.
Parceiro de prática de idiomas
Mantenha um diálogo falado em um idioma de destino, corrigindo erros em voz alta e ajustando a velocidade quando o aluno solicitar.
Assistente de campo sem uso das mãos
Permita que um técnico faça perguntas sobre um manual por voz e ouça as respostas enquanto mantém ambas as mãos no equipamento.
Exemplos de prompt
Você é um agente de suporte calmo de um provedor de internet. Peça o CEP da conta e, em seguida, guie o chamador pelo processo de reinicialização do roteador.
Pronuncie nossa marca 'Zyntra' como ZIN-tra, mantenha um tom amigável e nunca interrompa o chamador no meio da frase.
Aja como um tutor de português. Fale devagar, repita minha frase corrigida e faça uma pergunta de acompanhamento a cada turno.
FAQ
Qual é a diferença entre grok-voice-think-fast-2.0 e grok-voice-latest?
grok-voice-think-fast-2.0 é uma versão específica de modelo, enquanto grok-voice-latest é um alias que atualmente aponta para ela. O alias será direcionado a lançamentos mais recentes; o nome com data permanece na versão que você testou.
O Grok Voice Think Fast 2.0 é um modelo de conversão de texto em fala (text-to-speech)?
Não. Ele ouve e responde em uma sessão ao vivo, recebendo áudio e produzindo respostas faladas. Para transformar texto preparado em áudio, use o Grok Voice TTS; para transcrever gravações, use o Grok Voice STT.
Como ele decide quando terminei de falar?
As sessões podem ativar a detecção de atividade de voz no lado do servidor, que identifica o fim do turno do usuário e inicia a resposta. Você também pode gerenciar os turnos por conta própria se o seu cliente já contar com o recurso de apertar para falar (push-to-talk).
Quais vozes ele pode usar?
Uma sessão pode escolher entre as vozes integradas da xAI, com eve como padrão, ou uma voz personalizada clonada a partir de uma gravação de referência curta. As vozes integradas falam todos os idiomas suportados.
Quanto custa o Grok Voice Think Fast 2.0?
No TokenLab, Grok Voice Think Fast 2.0 custa $0.001333 por segundo. A tabela de preços acima mostra o detalhamento completo. As tarifas dependem da unidade de cobrança, da especificação e do uso. Compare condições iguais no preço detalhado do modelo; uma única tarifa não determina o custo total.
Qual endpoint o Grok Voice Think Fast 2.0 deve usar?
Use https://api.tokenlab.sh/v1/chat/completions para Grok Voice Think Fast 2.0. O exemplo de requisição abaixo mostra o formato de código correspondente.
Comparar Grok Voice Think Fast 2.0
Fontes
Revisado em 2 de out. de 2026