xAI: Grok Voice TTS
grok-voice-tts- Entrada / Saída
- $15.00 / $0.00
- Modalidades
- Áudio
Sobre o Grok Voice TTS
O Grok Voice TTS é o modelo de conversão de texto em fala (text-to-speech) da xAI, que renderiza texto escrito em áudio falado usando uma voz e um idioma escolhidos. Tags embutidas, como pausas, risadas e sussurros, moldam a entrega. Use-o para narração, notificações faladas e respostas de áudio localizadas onde o texto já está escrito e nenhuma conversa ao vivo é necessária.
Pontos fortes
- Tags de fala embutidas, como [pause] e [laugh], além de tags de encapsulamento como whisper, oferecem controle de entrega diretamente dentro do texto.
- Todas as vozes integradas falam os idiomas suportados, de modo que uma única identidade de voz pode ser mantida em versões localizadas do mesmo conteúdo.
- Vozes personalizadas podem ser clonadas a partir de um pequeno clipe de referência para vozes de marcas ou personagens.
- Marcas de tempo (timestamps) a nível de caractere podem ser retornadas para sincronizar legendas ou o movimento labial com o áudio.
Quando usar outro modelo
- Ele fala texto fixo; um chamador que interrompe ou responde precisa de um modelo de voz conversacional.
- A qualidade de saída para scripts longos depende da pontuação e das tags no texto de origem, portanto, um texto gerado por máquina sem edições pode soar monótono.
Primeiros passos
Criar chave de API
Crie uma chave no Console e use com qualquer modelo da plataforma.
Envie sua primeira requisição
Copie o exemplo para sua linguagem e execute-o no endpoint.
Texto para falaEndpoint do TokenLabPOST/v1/audio/speechcurl -X POST "https://api.tokenlab.sh/v1/audio/speech" \ -H "Authorization: Bearer sk-xxx" \ -H "Content-Type: application/json" \ -d '{ "language_code": "en", "operation": "tts", "response_format": "mp3", "voice": "eve", "model": "grok-voice-tts", "input": "Hello from TokenLab." }'
Preço
O preço oficial é a base pública do criador do modelo. O preço TokenLab é o que você paga por este modelo na TokenLab.
Preço
Por milhão de caracteres- Official
- Entrada$15.00/1 mi de caracteresSaída$0.00/1 mi de caracteres
- Preço oficial
- Entrada$15.00/1 mi de caracteresSaída$0.00/1 mi de caracteres
| Preço oficialPor milhão de caracteres | OfficialPor milhão de caracteres | Desconto | |
|---|---|---|---|
| Entrada | $15.00 | $15.00 | — |
| Saída | $0.00 | $0.00 | — |
Uso e atividade
A taxa de sucesso é a proporção de requisições concluídas. A latência é quanto tempo uma resposta completa leva; P95 significa que 95% das requisições terminaram dentro desse tempo.
Uso e disponibilidade
Últimas 24 horas- Requisições
- Taxa de sucesso
- Latência P95
- Total de tokens
Os dados baseiam-se em solicitações agregadas de usuários, excluindo verificações de status.
Abrir no Console
Abra Grok Voice TTS no Console com um prompt pronto para editar ou enviar.
Ajude-me a testar grok-voice-tts com uma solicitação de áudio em /v1/audio/speech. Exiba o resultado e custo.
Casos de uso
Artigos e aulas narrados
Transforme um artigo concluído ou um roteiro de curso em uma faixa de áudio, usando pausas para separar as seções.
Alertas falados
Leia atualizações de pedidos ou avisos de segurança no idioma do usuário por meio de um codec de telefonia.
Vídeos de produtos localizados
Duble o mesmo roteiro em vários idiomas usando uma voz escolhida e, em seguida, utilize marcas de tempo para alinhar as legendas.
Exemplos de prompt
Leia este parágrafo com uma voz calorosa e firme, adicionando uma breve [pause] após cada frase.
Fale o seguinte aviso em francês e, em seguida, repita-o em alemão, usando a mesma voz.
<whisper>Seu pacote foi enviado.</whisper> [pause] Ele deve chegar na quinta-feira.
FAQ
O que o Grok Voice TTS faz?
Ele converte texto em áudio falado. Você escolhe uma voz, opcionalmente um código de idioma e um formato de saída, e ele retorna o áudio correspondente ao texto, incluindo quaisquer tags expressivas inseridas no conteúdo.
Quais formatos de áudio ele pode produzir?
MP3, WAV e PCM bruto, além dos codecs de telefonia mu-law e A-law, com taxas de amostragem de 8 kHz a 48 kHz. Os codecs de telefonia adequam-se a sistemas telefônicos; o MP3 é ideal para reprodução na Web e em dispositivos móveis.
Quantos idiomas ele pode falar?
A xAI documenta vinte idiomas selecionados por código BCP-47, com detecção automática de idioma como alternativa. Cada voz integrada pode falar todos os idiomas suportados, portanto, mudar de idioma não exige o uso de uma nova voz.
Posso transmitir áudio enquanto o texto ainda está sendo gerado?
Sim. Um endpoint WebSocket gera áudio em tempo real à medida que o texto é enviado, o que ajuda quando outro modelo ainda está escrevendo a resposta que será falada.
Posso corrigir palavras pronunciadas incorretamente?
Sim. As substituições de pronúncia permitem mapear um termo escrito para a forma como ele deve soar, garantindo que nomes de marcas e siglas sejam pronunciados corretamente sem alterar o texto exibido.
Quanto custa o Grok Voice TTS?
No TokenLab, Grok Voice TTS custa Entrada $15.00 / Saída $0.00 Por milhão de caracteres. A tabela de preços acima mostra o detalhamento completo.
Qual endpoint o Grok Voice TTS deve usar?
Use https://api.tokenlab.sh/v1/audio/speech para Grok Voice TTS. O exemplo de requisição abaixo mostra o formato de código correspondente.
Quais operações o Grok Voice TTS suporta?
Grok Voice TTS suporta Texto para fala. Selecione uma operação acima para ver seu endpoint e exemplo de requisição.
Comparar Grok Voice TTS
Fontes
Revisado em 2 de out. de 2026