Escolha Auto, TokenLab Verified ou Official para cada solicitação, com preços exibidos antecipadamente.Veja as novidades

xAI: Grok TTS

O Grok TTS gera fala a partir de texto usando as vozes expressivas da xAI. A interface publicada retorna áudio em MP3 e permite a escolha de uma voz, tornando-o útil para respostas faladas, narração e saída de voz multilíngue.
Comparar modelos
grok-tts
DisponívelxAITexto para falaSíncrono
Entrada / Saída
$15.00 / $0.00
Modalidades
Áudio

Sobre o Grok TTS

Grok TTS é o modelo de conversão de texto em fala da xAI, transformando texto escrito em áudio falado com vozes expressivas. A interface retorna áudio MP3 e permite que você escolha uma voz. A xAI documenta tags de fala em linha para risadas, sussurros e pausas, para que os roteiros possam conter indicações de entrega. Ele é adequado para respostas faladas, narração e saída de voz multilíngue.

Pontos fortes

  • Oferece uma grande lista de vozes expressivas, para que você possa escolher uma que combine com o produto ou personagem.
  • Retorna áudio MP3, que é reproduzido em navegadores e aplicativos sem necessidade de conversão.
  • A xAI documenta tags em linha, como risadas, sussurros e pausas, para moldar a entrega dentro do texto.
  • Todas as vozes integradas funcionam em todos os idiomas suportados, portanto, uma voz pode falar vários idiomas.
  • Texto simples entra e um arquivo de áudio finalizado sai, o que mantém roteiros longos simples de automatizar.

Quando usar outro modelo

  • A saída é apenas MP3 através desta interface, portanto, formatos de telefonia precisam de conversão.
  • Clonagem de voz e entrega por streaming ao vivo são recursos separados e não fazem parte desta solicitação.
  • Roteiros longos precisam ser divididos em blocos, e você deve ouvir a pronúncia de nomes e siglas.

Primeiros passos

  1. Criar chave de API

    Crie uma chave no Console e use com qualquer modelo da plataforma.

  2. Envie sua primeira requisição

    Copie o exemplo para sua linguagem e execute-o no endpoint.

    Texto para falaEndpoint do TokenLab
    POST/v1/audio/speech
    curl -X POST "https://api.tokenlab.sh/v1/audio/speech" \
      -H "Authorization: Bearer sk-xxx" \
      -H "Content-Type: application/json" \
      -d '{
      "operation": "tts",
      "response_format": "mp3",
      "model": "grok-tts",
      "input": "Hello from TokenLab.",
      "voice": "alloy"
    }'

Preço

O preço oficial é a base pública do criador do modelo. O preço TokenLab é o que você paga por este modelo na TokenLab.

Texto para fala

Por milhão de caracteres
Preço oficial
Entrada $15.00 / Saída $0.00
Official
Entrada $15.00 / Saída $0.00
Desconto
—

Uso e atividade

A taxa de sucesso é a proporção de requisições concluídas. A latência é quanto tempo uma resposta completa leva; P95 significa que 95% das requisições terminaram dentro desse tempo.

Uso e disponibilidade

Últimas 24 horas
Requisições
Taxa de sucesso
Latência P95
Total de tokens
Desempenho do modelo
As métricas aparecerão assim que os limites de privacidade e volume de dados forem atingidos.

Os dados baseiam-se em solicitações agregadas de usuários, excluindo verificações de status.

Abrir no Console

Abra Grok TTS no Console com um prompt pronto para editar ou enviar.

Ajude-me a testar grok-tts com uma solicitação de áudio em /v1/audio/speech. Exiba o resultado e custo.

Casos de uso

  • Assistentes de voz

    Fale respostas de um modelo de chat em voz alta, escolhendo uma voz que se adeque ao produto.

  • Narração e audiolivros

    Converta artigos, lições ou capítulos em arquivos de áudio, adicionando tags de pausa onde o ritmo precisar de uma interrupção.

  • Anúncios multilíngues

    Produza a mesma mensagem em vários idiomas usando uma voz para uma identidade sonora consistente da marca.

Exemplos de prompt

Bem-vindo de volta! [pausa] Seu pedido foi enviado e deve chegar na quinta-feira.

Leia esta descrição de produto em um tom calmo e amigável, sussurrando a linha final.

Narre o parágrafo a seguir em francês em um ritmo uniforme, com uma pequena pausa após cada frase.

FAQ

O que é o Grok TTS?

É o modelo de conversão de texto em fala da xAI. Você envia texto, escolhe uma voz e recebe áudio falado como um arquivo MP3. Ele é destinado a respostas faladas, narração e saída de voz multilíngue a partir de texto escrito.

Posso escolher uma voz?

Sim. A xAI fornece uma lista de vozes expressivas, com 'eve' como padrão. A voz é uma opção de solicitação, portanto, você pode alterá-la por chamada para se adequar ao roteiro.

Ele suporta fala expressiva?

A xAI documenta tags de fala em linha para efeitos como risadas, sussurros e pausas. Coloque-as no texto onde deseja o efeito e ouça o resultado.

Quais idiomas ele pode falar?

A xAI afirma que suas vozes integradas funcionam em todos os idiomas disponíveis. Teste seu idioma com uma passagem curta primeiro, prestando atenção a nomes e números.

Qual formato de áudio ele retorna?

MP3, que é reproduzido diretamente em navegadores e aplicativos móveis. Se sua plataforma precisar de outro formato, como áudio de telefonia, converta o arquivo após a geração. Qualquer ferramenta de áudio padrão pode fazer a conversão.

Quanto custa o Grok TTS?

No TokenLab, Grok TTS custa Entrada $15.00 / Saída $0.00 Por milhão de caracteres. A tabela de preços acima mostra o detalhamento completo. As tarifas dependem da unidade de cobrança, da especificação e do uso. Compare condições iguais no preço detalhado do modelo; uma única tarifa não determina o custo total.

Qual endpoint o Grok TTS deve usar?

Use https://api.tokenlab.sh/v1/audio/speech para Grok TTS. O exemplo de requisição abaixo mostra o formato de código correspondente.

Quais operações o Grok TTS suporta?

Grok TTS suporta Texto para fala. Selecione uma operação acima para ver seu endpoint e exemplo de requisição.

Comparar Grok TTS

Fontes

Revisado em 2 de out. de 2026

Mais da série Grok Voice

Modelos relacionados