Elija Auto, TokenLab Verified o Official para cada solicitud, con los precios mostrados por adelantado.Ver las novedades

xAI: Grok TTS

Grok TTS genera voz a partir de texto utilizando las voces expresivas de xAI. La interfaz publicada devuelve audio en formato MP3 y permite elegir una voz, lo que lo hace útil para respuestas habladas, narración y salida de voz multilingüe.
Comparar modelos
grok-tts
DisponiblexAITexto a vozSíncrono
Entrada / Salida
$15.00 / $0.00
Modalidades
Audio

Sobre Grok TTS

Grok TTS es el modelo de texto a voz de xAI, que convierte texto escrito en audio hablado con voces expresivas. La interfaz devuelve audio MP3 y le permite elegir una voz. xAI documenta etiquetas de voz integradas para risas, susurros y pausas, de modo que los guiones puedan incluir indicaciones de entrega. Es adecuado para respuestas habladas, narración y salida de voz multilingüe.

Puntos fuertes

  • Ofrece una amplia lista de voces expresivas, para que pueda elegir una que coincida con el producto o personaje.
  • Devuelve audio MP3, que se reproduce en navegadores y aplicaciones sin necesidad de conversión.
  • xAI documenta etiquetas integradas como risas, susurros y pausas para dar forma a la entrega dentro del texto.
  • Todas las voces integradas funcionan en los idiomas admitidos, por lo que una sola voz puede hablar varios idiomas.
  • Se introduce texto plano y sale un archivo de audio terminado, lo que mantiene los guiones largos fáciles de automatizar.

Cuándo buscar otra opción

  • La salida es solo MP3 a través de esta interfaz, por lo que los formatos de telefonía requieren conversión.
  • La clonación de voz y la entrega por streaming en vivo son funciones independientes y no forman parte de esta solicitud.
  • Los guiones largos deben dividirse en fragmentos, y debe escuchar la pronunciación de nombres y acrónimos.

Primeros pasos

  1. Crear clave API

    Genera una clave en Console y úsala con cualquier modelo de la plataforma.

  2. Envía tu primera solicitud

    Copia el ejemplo para tu lenguaje y ejecútalo contra el endpoint.

    Texto a vozEndpoint de TokenLab
    POST/v1/audio/speech
    curl -X POST "https://api.tokenlab.sh/v1/audio/speech" \
      -H "Authorization: Bearer sk-xxx" \
      -H "Content-Type: application/json" \
      -d '{
      "operation": "tts",
      "response_format": "mp3",
      "model": "grok-tts",
      "input": "Hello from TokenLab.",
      "voice": "alloy"
    }'

Precios

El precio oficial es la línea base pública del creador del modelo. El precio de TokenLab es lo que pagas por este modelo en TokenLab.

Texto a voz

Por millón de caracteres
Precio Official
Entrada $15.00 / Salida $0.00
Official
Entrada $15.00 / Salida $0.00
Descuento
—

Uso y actividad

La tasa de éxito es la proporción de solicitudes completadas. La latencia es cuánto tarda una respuesta completa; P95 significa que el 95 % de las solicitudes terminaron dentro de ese tiempo.

Uso y disponibilidad

Últimas 24 horas
Solicitudes
Tasa de éxito
Latencia P95
Total de tokens
Desempeño del modelo
Las métricas aparecerán una vez que se alcancen los umbrales de privacidad y volumen de datos.

Los datos se basan en solicitudes de usuario agregadas, excluyendo las comprobaciones de estado.

Abrir en Console

Abre Grok TTS en Console con un prompt listo para editar o enviar.

Ayúdame a probar grok-tts con una solicitud de audio breve en /v1/audio/speech. Muestra el resultado y el coste.

Casos de uso

  • Asistentes de voz

    Diga las respuestas de un modelo de chat en voz alta, eligiendo una voz que se ajuste al producto.

  • Narración y audiolibros

    Convierta artículos, lecciones o capítulos en archivos de audio, añadiendo etiquetas de pausa donde el ritmo necesite un descanso.

  • Anuncios multilingües

    Produzca el mismo mensaje en varios idiomas usando una sola voz para un sonido de marca consistente.

Ejemplos de prompts

¡Bienvenido de nuevo! [pausa] Su pedido ha sido enviado y debería llegar el jueves.

Lee esta descripción de producto con un tono tranquilo y amable, susurrando la última línea.

Narra el siguiente párrafo en francés a un ritmo uniforme, con una breve pausa después de cada oración.

FAQ

¿Qué es Grok TTS?

Es el modelo de texto a voz de xAI. Usted envía texto, elige una voz y recibe audio hablado como un archivo MP3. Está destinado a respuestas habladas, narración y salida de voz multilingüe a partir de texto escrito.

¿Puedo elegir una voz?

Sí. xAI proporciona una lista de voces expresivas, con 'eve' como predeterminada. La voz es una opción de solicitud, por lo que puede cambiarla en cada llamada para adaptarse al guion.

¿Admite habla expresiva?

xAI documenta etiquetas de voz integradas para efectos como risas, susurros y pausas. Colóquelas en el texto donde desee el efecto y escuche el resultado.

¿Qué idiomas puede hablar?

xAI afirma que sus voces integradas funcionan en todos los idiomas disponibles. Pruebe su idioma con un pasaje corto primero, prestando atención a los nombres y números.

¿Qué formato de audio devuelve?

MP3, que se reproduce directamente en navegadores y aplicaciones móviles. Si su plataforma necesita otro formato, como audio de telefonía, convierta el archivo después de la generación. Cualquier herramienta de audio estándar puede realizar la conversión.

¿Cuánto cuesta Grok TTS?

En TokenLab, Grok TTS cuesta Entrada $15.00 / Salida $0.00 Por millón de caracteres. La tabla de precios arriba muestra el desglose completo. Las tarifas dependen de la unidad de facturación, la especificación y el uso. Compare condiciones iguales en el precio detallado del modelo; una sola tarifa no determina el coste total.

¿Qué endpoint debe usar Grok TTS?

Utiliza https://api.tokenlab.sh/v1/audio/speech para Grok TTS. El ejemplo de solicitud a continuación muestra la estructura de código correspondiente.

¿Qué operaciones soporta Grok TTS?

Grok TTS admite Texto a voz. Selecciona una operación arriba para ver su endpoint y ejemplo de solicitud.

Comparar Grok TTS

Fuentes

Revisado el 2 oct 2026

Más de Grok Voice

Modelos relacionados