xAI: Grok Voice TTS
grok-voice-tts- Entrada / Salida
- $15.00 / $0.00
- Modalidades
- Audio
Sobre Grok Voice TTS
Grok Voice TTS es el modelo de texto a voz de xAI, que convierte texto escrito en audio hablado con una voz e idioma seleccionados. Las etiquetas integradas como pausas, risas y susurros moldean la entrega. Úselo para narraciones, notificaciones habladas y respuestas de audio localizadas donde el texto ya está escrito y no se requiere una conversación en vivo.
Puntos fuertes
- Las etiquetas de voz integradas como [pause] y [laugh], además de etiquetas envolventes como 'whisper', permiten controlar la entrega dentro del propio texto.
- Todas las voces integradas hablan los idiomas compatibles, por lo que una misma identidad de voz puede utilizarse en versiones localizadas del mismo contenido.
- Las voces personalizadas pueden clonarse a partir de un clip de referencia corto para obtener voces de marca o de personajes.
- Se pueden devolver marcas de tiempo a nivel de carácter para sincronizar subtítulos o el movimiento de los labios con el audio.
Cuándo buscar otra opción
- Habla texto fijo; un interlocutor que interrumpe o responde necesita un modelo de voz conversacional en su lugar.
- La calidad de salida para guiones largos depende de la puntuación y las etiquetas en el texto fuente, por lo que el texto generado por máquina sin editar puede sonar monótono.
Primeros pasos
Crear clave API
Genera una clave en Console y úsala con cualquier modelo de la plataforma.
Envía tu primera solicitud
Copia el ejemplo para tu lenguaje y ejecútalo contra el endpoint.
Texto a vozEndpoint de TokenLabPOST/v1/audio/speechcurl -X POST "https://api.tokenlab.sh/v1/audio/speech" \ -H "Authorization: Bearer sk-xxx" \ -H "Content-Type: application/json" \ -d '{ "language_code": "en", "operation": "tts", "response_format": "mp3", "voice": "eve", "model": "grok-voice-tts", "input": "Hello from TokenLab." }'
Precios
El precio oficial es la línea base pública del creador del modelo. El precio de TokenLab es lo que pagas por este modelo en TokenLab.
Precios
Por millón de caracteres- Official
- Entrada$15.00/1 M de caracteresSalida$0.00/1 M de caracteres
- Precio Official
- Entrada$15.00/1 M de caracteresSalida$0.00/1 M de caracteres
| Precio OfficialPor millón de caracteres | OfficialPor millón de caracteres | Descuento | |
|---|---|---|---|
| Entrada | $15.00 | $15.00 | — |
| Salida | $0.00 | $0.00 | — |
Uso y actividad
La tasa de éxito es la proporción de solicitudes completadas. La latencia es cuánto tarda una respuesta completa; P95 significa que el 95 % de las solicitudes terminaron dentro de ese tiempo.
Uso y disponibilidad
Últimas 24 horas- Solicitudes
- Tasa de éxito
- Latencia P95
- Total de tokens
Los datos se basan en solicitudes de usuario agregadas, excluyendo las comprobaciones de estado.
Abrir en Console
Abre Grok Voice TTS en Console con un prompt listo para editar o enviar.
Ayúdame a probar grok-voice-tts con una solicitud de audio breve en /v1/audio/speech. Muestra el resultado y el coste.
Casos de uso
Artículos y lecciones narradas
Convierta un artículo terminado o un guion de curso en una pista de audio, utilizando pausas para separar secciones.
Alertas habladas
Lea actualizaciones de pedidos o avisos de seguridad en el idioma del usuario a través de un códec de telefonía.
Videos de productos localizados
Ponga voz al mismo guion en varios idiomas con una voz elegida y luego utilice las marcas de tiempo para alinear los subtítulos.
Ejemplos de prompts
Lee este párrafo con una voz cálida y constante, y añade una breve [pause] después de cada frase.
Habla el siguiente aviso en francés y luego repítelo en alemán, usando la misma voz.
<whisper>Tu paquete ha sido enviado.</whisper> [pause] Debería llegar el jueves.
FAQ
¿Qué hace Grok Voice TTS?
Convierte texto en audio hablado. Usted elige una voz, opcionalmente un código de idioma y un formato de salida, y devuelve el audio del texto, incluyendo cualquier etiqueta expresiva que haya escrito en línea.
¿Qué formatos de audio puede producir?
MP3, WAV y PCM sin procesar, además de códecs de telefonía mu-law y A-law, con frecuencias de muestreo de 8 kHz a 48 kHz. Los códecs de telefonía se adaptan a los sistemas telefónicos; el MP3 es adecuado para la reproducción web y móvil.
¿Cuántos idiomas puede hablar?
xAI documenta veinte idiomas seleccionados por código BCP-47, con detección automática de idioma como alternativa. Cada voz integrada puede hablar todos los idiomas compatibles, por lo que cambiar de idioma no requiere una nueva voz.
¿Puedo transmitir audio mientras el texto aún está llegando?
Sí. Un endpoint WebSocket genera audio en tiempo real a medida que se envía el texto, lo cual ayuda cuando otro modelo aún está escribiendo la respuesta que será hablada.
¿Puedo corregir palabras mal pronunciadas?
Sí. Los reemplazos de pronunciación le permiten asignar un término escrito a cómo debería sonar, de modo que los nombres de marca y acrónimos se escuchen correctamente sin editar el texto mostrado.
¿Cuánto cuesta Grok Voice TTS?
En TokenLab, Grok Voice TTS cuesta Entrada $15.00 / Salida $0.00 Por millón de caracteres. La tabla de precios arriba muestra el desglose completo.
¿Qué endpoint debe usar Grok Voice TTS?
Utiliza https://api.tokenlab.sh/v1/audio/speech para Grok Voice TTS. El ejemplo de solicitud a continuación muestra la estructura de código correspondiente.
¿Qué operaciones soporta Grok Voice TTS?
Grok Voice TTS admite Texto a voz. Selecciona una operación arriba para ver su endpoint y ejemplo de solicitud.
Comparar Grok Voice TTS
Fuentes
Revisado el 2 oct 2026