Escolha Auto, TokenLab Verified ou Official para cada solicitação, com preços exibidos antecipadamente.Veja as novidades

xAI: Grok Voice TTS

O Grok Voice TTS cria fala a partir de texto escrito com uma voz e idioma escolhidos. Adapta-se a narração localizada, notificações faladas e aplicações que precisam renderizar texto preparado como uma resposta de áudio.
Comparar modelos
grok-voice-tts
DisponívelxAITexto para falaSíncrono
Entrada / Saída
$15.00 / $0.00
Modalidades
Áudio

Sobre o Grok Voice TTS

O Grok Voice TTS é o modelo de conversão de texto em fala (text-to-speech) da xAI, que renderiza texto escrito em áudio falado usando uma voz e um idioma escolhidos. Tags embutidas, como pausas, risadas e sussurros, moldam a entrega. Use-o para narração, notificações faladas e respostas de áudio localizadas onde o texto já está escrito e nenhuma conversa ao vivo é necessária.

Pontos fortes

  • Tags de fala embutidas, como [pause] e [laugh], além de tags de encapsulamento como whisper, oferecem controle de entrega diretamente dentro do texto.
  • Todas as vozes integradas falam os idiomas suportados, de modo que uma única identidade de voz pode ser mantida em versões localizadas do mesmo conteúdo.
  • Vozes personalizadas podem ser clonadas a partir de um pequeno clipe de referência para vozes de marcas ou personagens.
  • Marcas de tempo (timestamps) a nível de caractere podem ser retornadas para sincronizar legendas ou o movimento labial com o áudio.

Quando usar outro modelo

  • Ele fala texto fixo; um chamador que interrompe ou responde precisa de um modelo de voz conversacional.
  • A qualidade de saída para scripts longos depende da pontuação e das tags no texto de origem, portanto, um texto gerado por máquina sem edições pode soar monótono.

Primeiros passos

  1. Criar chave de API

    Crie uma chave no Console e use com qualquer modelo da plataforma.

  2. Envie sua primeira requisição

    Copie o exemplo para sua linguagem e execute-o no endpoint.

    Texto para falaEndpoint do TokenLab
    POST/v1/audio/speech
    curl -X POST "https://api.tokenlab.sh/v1/audio/speech" \
      -H "Authorization: Bearer sk-xxx" \
      -H "Content-Type: application/json" \
      -d '{
      "language_code": "en",
      "operation": "tts",
      "response_format": "mp3",
      "voice": "eve",
      "model": "grok-voice-tts",
      "input": "Hello from TokenLab."
    }'

Preço

O preço oficial é a base pública do criador do modelo. O preço TokenLab é o que você paga por este modelo na TokenLab.

Preço

Por milhão de caracteres
Official
Entrada$15.00/1 mi de caracteresSaída$0.00/1 mi de caracteres
Preço oficial
Entrada$15.00/1 mi de caracteresSaída$0.00/1 mi de caracteres

Uso e atividade

A taxa de sucesso é a proporção de requisições concluídas. A latência é quanto tempo uma resposta completa leva; P95 significa que 95% das requisições terminaram dentro desse tempo.

Uso e disponibilidade

Últimas 24 horas
Requisições
Taxa de sucesso
Latência P95
Total de tokens
Desempenho do modelo
As métricas aparecerão assim que os limites de privacidade e volume de dados forem atingidos.

Os dados baseiam-se em solicitações agregadas de usuários, excluindo verificações de status.

Abrir no Console

Abra Grok Voice TTS no Console com um prompt pronto para editar ou enviar.

Ajude-me a testar grok-voice-tts com uma solicitação de áudio em /v1/audio/speech. Exiba o resultado e custo.

Casos de uso

  • Artigos e aulas narrados

    Transforme um artigo concluído ou um roteiro de curso em uma faixa de áudio, usando pausas para separar as seções.

  • Alertas falados

    Leia atualizações de pedidos ou avisos de segurança no idioma do usuário por meio de um codec de telefonia.

  • Vídeos de produtos localizados

    Duble o mesmo roteiro em vários idiomas usando uma voz escolhida e, em seguida, utilize marcas de tempo para alinhar as legendas.

Exemplos de prompt

Leia este parágrafo com uma voz calorosa e firme, adicionando uma breve [pause] após cada frase.

Fale o seguinte aviso em francês e, em seguida, repita-o em alemão, usando a mesma voz.

<whisper>Seu pacote foi enviado.</whisper> [pause] Ele deve chegar na quinta-feira.

FAQ

O que o Grok Voice TTS faz?

Ele converte texto em áudio falado. Você escolhe uma voz, opcionalmente um código de idioma e um formato de saída, e ele retorna o áudio correspondente ao texto, incluindo quaisquer tags expressivas inseridas no conteúdo.

Quais formatos de áudio ele pode produzir?

MP3, WAV e PCM bruto, além dos codecs de telefonia mu-law e A-law, com taxas de amostragem de 8 kHz a 48 kHz. Os codecs de telefonia adequam-se a sistemas telefônicos; o MP3 é ideal para reprodução na Web e em dispositivos móveis.

Quantos idiomas ele pode falar?

A xAI documenta vinte idiomas selecionados por código BCP-47, com detecção automática de idioma como alternativa. Cada voz integrada pode falar todos os idiomas suportados, portanto, mudar de idioma não exige o uso de uma nova voz.

Posso transmitir áudio enquanto o texto ainda está sendo gerado?

Sim. Um endpoint WebSocket gera áudio em tempo real à medida que o texto é enviado, o que ajuda quando outro modelo ainda está escrevendo a resposta que será falada.

Posso corrigir palavras pronunciadas incorretamente?

Sim. As substituições de pronúncia permitem mapear um termo escrito para a forma como ele deve soar, garantindo que nomes de marcas e siglas sejam pronunciados corretamente sem alterar o texto exibido.

Quanto custa o Grok Voice TTS?

No TokenLab, Grok Voice TTS custa Entrada $15.00 / Saída $0.00 Por milhão de caracteres. A tabela de preços acima mostra o detalhamento completo.

Qual endpoint o Grok Voice TTS deve usar?

Use https://api.tokenlab.sh/v1/audio/speech para Grok Voice TTS. O exemplo de requisição abaixo mostra o formato de código correspondente.

Quais operações o Grok Voice TTS suporta?

Grok Voice TTS suporta Texto para fala. Selecione uma operação acima para ver seu endpoint e exemplo de requisição.

Comparar Grok Voice TTS

Fontes

Revisado em 2 de out. de 2026

Mais da série Grok Voice

Modelos relacionados