Escolha Auto, TokenLab Verified ou Official para cada solicitação, com preços exibidos antecipadamente.Veja as novidades

xAI: Grok Voice Latest

O Grok Voice Latest fornece uma sessão de voz conversacional com vozes selecionáveis e interação com ferramentas. É útil para assistentes falados cujas respostas precisam permanecer conectadas a ações e informações da aplicação ao redor.
Comparar modelos
grok-voice-latest
DisponívelxAIÁudioSíncronoNovo
Preço
A partir de $0.001333
Lançado
23 de abr. de 2026
Modalidades
Áudio

Sobre o Grok Voice Latest

Grok Voice Latest é o alias flutuante da xAI para seu modelo atual de fala para fala (speech-to-speech) em tempo real, usado para conduzir uma conversa falada por uma sessão WebSocket. No momento da avaliação, ele aponta para grok-voice-think-fast-2.0. Escolha-o quando um assistente de voz deve incorporar as melhorias da xAI sem alteração de código; fixe a versão do modelo quando o comportamento precisar permanecer inalterado.

Pontos fortes

  • É o alias que a xAI recomenda para agentes de voz que devem receber atualizações de modelo automaticamente, sem nenhuma alteração na configuração da sessão.
  • Uma sessão aceita vozes nativas ou personalizadas, detecção de atividade de voz no lado do servidor para alternância de turnos (turn-taking) e dicas de idioma para transcrição.
  • Agentes podem chamar pesquisas na web e no X, busca de arquivos em coleções de documentos, servidores MCP remotos e ferramentas de funções personalizadas.
  • As sessões podem ser retomadas após uma queda de conexão reutilizando um ID de conversa, o que é adequado para clientes telefônicos e móveis.

Quando usar outro modelo

  • Como o alias se move, a voz, o ritmo ou a escolha de palavras podem mudar após uma atualização; fixe o modelo versionado para produtos testados contra regressão.
  • Ele lida apenas com sessões de áudio ao vivo; transcrever gravações armazenadas ou renderizar texto preparado requer os modelos de conversão de fala em texto (speech-to-text) ou de texto em fala (text-to-speech).

Primeiros passos

  1. Criar chave de API

    Crie uma chave no Console e use com qualquer modelo da plataforma.

  2. Envie sua primeira requisição

    Copie o exemplo para sua linguagem e execute-o no endpoint.

    Tempo realWebSocket
    WS/v1/realtime
    // npm install ws
    import WebSocket from 'ws';
    
    const socket = new WebSocket("wss://api.tokenlab.sh/v1/realtime?model=grok-voice-latest", {
      headers: { Authorization: "Bearer sk-xxx" }
    });
    
    socket.on('open', () => {
      // Send the input events supported by this model with socket.send(...).
      // https://tokenlab.sh/docs/en/api-reference/realtime/connect
    });
    socket.on('message', (data) => console.log(data.toString()));
    socket.on('error', (error) => console.error(error));
    socket.on('close', (code, reason) => console.log(code, reason.toString()));
    
    // Close the session when finished.
    process.on('SIGINT', () => socket.close());

Preço

O preço oficial é a base pública do criador do modelo. O preço TokenLab é o que você paga por este modelo na TokenLab.

Audio Duration

por segundo
Preço oficial
$0.001333
Official
$0.001333
Desconto
—

Uso e atividade

A taxa de sucesso é a proporção de requisições concluídas. A latência é quanto tempo uma resposta completa leva; P95 significa que 95% das requisições terminaram dentro desse tempo.

Uso e disponibilidade

Últimas 24 horas
Requisições
Taxa de sucesso
Latência P95
Total de tokens
Desempenho do modelo
As métricas aparecerão assim que os limites de privacidade e volume de dados forem atingidos.

Os dados baseiam-se em solicitações agregadas de usuários, excluindo verificações de status.

Abrir no Console

Abra Grok Voice Latest no Console com um prompt pronto para editar ou enviar.

Ajude-me a testar grok-voice-latest com uma solicitação de áudio em /v1/realtime. Exiba o resultado e custo.

Casos de uso

  • Agentes para telefonia e centrais de atendimento (call center)

    Atender chamadas de entrada usando codecs de telefonia, consultar uma conta por meio de uma ferramenta de função e transferir o chamador para uma pessoa quando a solicitação estiver fora da política.

  • Assistente de voz integrado ao aplicativo

    Permitir que os usuários falem com um produto, com tokens efêmeros mantendo a chave de API fora do cliente e ferramentas alcançando os dados por trás do aplicativo.

  • Divulgações com roteiro dentro de uma chamada ao vivo

    Inserir uma linha fixa e obrigatória para um aviso de conformidade enquanto o modelo lida com o resto da conversa.

Exemplos de prompt

Você é um assistente de agendamento para uma clínica odontológica. Cumprimente o chamador, pergunte do que ele precisa e ofereça os próximos dois horários disponíveis usando a ferramenta de calendário.

Mude para o espanhol quando o chamador o fizer, mantenha as respostas com no máximo duas frases e confirme o valor total do pedido antes de encerrar a chamada.

Pesquise em nossa coleção de políticas de devolução, responda à pergunta do cliente em voz alta e diga qual documento você usou.

FAQ

Qual modelo o grok-voice-latest executa?

É um alias que atualmente resolve para grok-voice-think-fast-2.0, o modelo de fala para fala em tempo real na suíte Grok Voice da xAI. A xAI aconselha o uso do alias para receber melhorias automaticamente, de modo que a versão subjacente pode mudar ao longo do tempo.

Quando devo fixar uma versão em vez de usar o alias?

Fixe o modelo versionado quando você tiver testado prompts, escolha de voz e comportamento de ferramentas e precisar que eles permaneçam estáveis. Use o alias em protótipos e produtos onde absorver atualizações sem reimplantar importa mais do que a repetibilidade exata.

Quais formatos de áudio uma sessão usa?

As sessões transportam PCM em taxas de amostragem de 8 kHz a 48 kHz, G.711 mu-law e A-law para telefonia, e Opus. O áudio trafega como mensagens JSON em base64 ou como quadros (frames) WebSocket binários.

O agente de voz pode chamar ferramentas?

Sim, de acordo com a documentação de voz da xAI: pesquisa na web e no X, busca de arquivos, servidores MCP remotos e suas próprias ferramentas de função definidas com esquemas JSON. Verifique se a sua integração passa as definições de ferramentas na configuração da sessão.

Posso manter uma conversa após uma desconexão?

Sim. A retomada de sessão faz cache de turnos anteriores sob um ID de conversa, de modo que um cliente que se reconecta após uma queda de rede pode continuar o mesmo diálogo em vez de recomeçar do zero.

Quanto custa o Grok Voice Latest?

No TokenLab, Grok Voice Latest custa $0.001333 por segundo. A tabela de preços acima mostra o detalhamento completo. As tarifas dependem da unidade de cobrança, da especificação e do uso. Compare condições iguais no preço detalhado do modelo; uma única tarifa não determina o custo total.

Qual endpoint o Grok Voice Latest deve usar?

Use https://api.tokenlab.sh/v1/realtime para Grok Voice Latest. O exemplo de requisição abaixo mostra o formato de código correspondente.

Quais operações o Grok Voice Latest suporta?

Grok Voice Latest suporta Tempo real. Selecione uma operação acima para ver seu endpoint e exemplo de requisição.

Comparar Grok Voice Latest

Guias com Grok Voice Latest

Fontes

Revisado em 2 de out. de 2026

Mais da série Grok Voice

Modelos relacionados