Elija Auto, TokenLab Verified o Official para cada solicitud, con los precios mostrados por adelantado.Ver las novedades

xAI: Grok Voice Latest

Grok Voice Latest proporciona una sesión de voz conversacional con voces seleccionables e interacción con herramientas. Es útil para asistentes hablados cuyas respuestas deben permanecer conectadas a acciones e información de la aplicación circundante.
Comparar modelos
grok-voice-latest
DisponiblexAIAudioSíncronoReciente
Precio
Desde $0.001333
Lanzado
23 abr 2026
Modalidades
Audio

Sobre Grok Voice Latest

Grok Voice Latest es el alias flotante de xAI para su modelo actual de voz a voz en tiempo real, utilizado para mantener una conversación hablada a través de una sesión WebSocket. En el momento de la revisión, apunta a grok-voice-think-fast-2.0. Elíjalo cuando un asistente de voz deba adoptar las mejoras de xAI sin necesidad de cambiar el código; fije el modelo con versión cuando el comportamiento deba permanecer invariable.

Puntos fuertes

  • Es el alias que xAI recomienda para agentes de voz que deban recibir actualizaciones de modelo automáticamente, sin cambios en la configuración de la sesión.
  • Una sesión acepta voces integradas o personalizadas, detección de actividad de voz del lado del servidor para el turno de palabra y sugerencias de idioma para la transcripción.
  • Los agentes pueden realizar búsquedas en la web y en X, búsquedas de archivos en colecciones de documentos, utilizar servidores MCP remotos y herramientas de funciones personalizadas.
  • Las sesiones pueden reanudarse tras una desconexión reutilizando un ID de conversación, lo cual es adecuado para clientes telefónicos y móviles.

Cuándo buscar otra opción

  • Debido a que el alias cambia, la voz, el ritmo o la redacción pueden variar tras una actualización; fije el modelo con versión para productos que requieran pruebas de regresión.
  • Gestiona únicamente sesiones de audio en vivo; para transcribir grabaciones almacenadas o procesar texto preparado, se necesitan los modelos de voz a texto o de texto a voz.

Primeros pasos

  1. Crear clave API

    Genera una clave en Console y úsala con cualquier modelo de la plataforma.

  2. Envía tu primera solicitud

    Copia el ejemplo para tu lenguaje y ejecútalo contra el endpoint.

    Tiempo realWebSocket
    WS/v1/realtime
    // npm install ws
    import WebSocket from 'ws';
    
    const socket = new WebSocket("wss://api.tokenlab.sh/v1/realtime?model=grok-voice-latest", {
      headers: { Authorization: "Bearer sk-xxx" }
    });
    
    socket.on('open', () => {
      // Send the input events supported by this model with socket.send(...).
      // https://tokenlab.sh/docs/en/api-reference/realtime/connect
    });
    socket.on('message', (data) => console.log(data.toString()));
    socket.on('error', (error) => console.error(error));
    socket.on('close', (code, reason) => console.log(code, reason.toString()));
    
    // Close the session when finished.
    process.on('SIGINT', () => socket.close());

Precios

El precio oficial es la línea base pública del creador del modelo. El precio de TokenLab es lo que pagas por este modelo en TokenLab.

Audio Duration

por segundo
Precio Official
$0.001333
Official
$0.001333
Descuento
—

Uso y actividad

La tasa de éxito es la proporción de solicitudes completadas. La latencia es cuánto tarda una respuesta completa; P95 significa que el 95 % de las solicitudes terminaron dentro de ese tiempo.

Uso y disponibilidad

Últimas 24 horas
Solicitudes
Tasa de éxito
Latencia P95
Total de tokens
Desempeño del modelo
Las métricas aparecerán una vez que se alcancen los umbrales de privacidad y volumen de datos.

Los datos se basan en solicitudes de usuario agregadas, excluyendo las comprobaciones de estado.

Abrir en Console

Abre Grok Voice Latest en Console con un prompt listo para editar o enviar.

Ayúdame a probar grok-voice-latest con una solicitud de audio breve en /v1/realtime. Muestra el resultado y el coste.

Casos de uso

  • Agentes telefónicos y de centros de llamadas

    Responder llamadas entrantes mediante códecs de telefonía, buscar una cuenta a través de una herramienta de función y transferir al interlocutor a una persona cuando la solicitud quede fuera de la política.

  • Asistente de voz en la aplicación

    Permitir que los usuarios hablen con un producto, utilizando tokens efímeros para mantener la clave API fuera del cliente y herramientas que acceden a los datos detrás de la aplicación.

  • Divulgaciones con guion dentro de una llamada en vivo

    Insertar una línea fija y obligatoria para un aviso de cumplimiento mientras el modelo gestiona el resto de la conversación.

Ejemplos de prompts

Eres un asistente de reservas para una clínica dental. Saluda al interlocutor, pregúntale qué necesita y ofrécele los dos próximos espacios disponibles utilizando la herramienta de calendario.

Cambia al español cuando el interlocutor lo haga, mantén las respuestas por debajo de dos frases y confirma el total del pedido antes de finalizar la llamada.

Busca en nuestra colección de políticas de devolución, responde a la pregunta del cliente en voz alta e indica qué documento has utilizado.

FAQ

¿Qué modelo ejecuta grok-voice-latest?

Es un alias que actualmente se resuelve en grok-voice-think-fast-2.0, el modelo de voz a voz en tiempo real de la suite Grok Voice de xAI. xAI aconseja utilizar el alias para recibir mejoras automáticamente, por lo que la versión subyacente puede cambiar con el tiempo.

¿Cuándo debería fijar una versión en lugar de utilizar el alias?

Fije el modelo con versión cuando haya probado los prompts, la elección de voz y el comportamiento de las herramientas y necesite que permanezcan estables. Utilice el alias en prototipos y productos donde sea más importante recibir actualizaciones sin necesidad de volver a implementar que la repetibilidad exacta.

¿Qué formatos de audio utiliza una sesión?

Las sesiones transportan PCM a frecuencias de muestreo de 8 kHz a 48 kHz, G.711 mu-law y A-law para telefonía, y Opus. El audio viaja como mensajes JSON en base64 o como tramas binarias de WebSocket.

¿Puede el agente de voz llamar a herramientas?

Sí, según la documentación de voz de xAI: búsqueda en la web y en X, búsqueda de archivos, servidores MCP remotos y sus propias herramientas de funciones definidas con esquemas JSON. Compruebe que su integración pase las definiciones de herramientas en la configuración de la sesión.

¿Puedo mantener una conversación después de una desconexión?

Sí. La reanudación de la sesión almacena los turnos anteriores bajo un ID de conversación, de modo que un cliente que se reconecta tras una caída de red puede continuar el mismo diálogo en lugar de empezar de cero.

¿Cuánto cuesta Grok Voice Latest?

En TokenLab, Grok Voice Latest cuesta $0.001333 por segundo. La tabla de precios arriba muestra el desglose completo. Las tarifas dependen de la unidad de facturación, la especificación y el uso. Compare condiciones iguales en el precio detallado del modelo; una sola tarifa no determina el coste total.

¿Qué endpoint debe usar Grok Voice Latest?

Utiliza https://api.tokenlab.sh/v1/realtime para Grok Voice Latest. El ejemplo de solicitud a continuación muestra la estructura de código correspondiente.

¿Qué operaciones soporta Grok Voice Latest?

Grok Voice Latest admite Tiempo real. Selecciona una operación arriba para ver su endpoint y ejemplo de solicitud.

Comparar Grok Voice Latest

Guías con Grok Voice Latest

Fuentes

Revisado el 2 oct 2026

Más de Grok Voice

Modelos relacionados