Elija Auto, TokenLab Verified o Official para cada solicitud, con los precios mostrados por adelantado.Ver las novedades

xAI: Grok Voice Think Fast 2.0

Grok Voice Think Fast 2.0 es un modelo de voz para conversación en vivo. Es un candidato para interfaces habladas en las que el asistente debe seguir el ritmo de un intercambio en curso en lugar de simplemente leer un guion preparado.
Comparar modelos
grok-voice-think-fast-2.0
DisponiblexAIAudioSíncrono
Precio
Desde $0.001333
Modalidades
Audio

Sobre Grok Voice Think Fast 2.0

Grok Voice Think Fast 2.0 es el modelo de voz en tiempo real de xAI para conversaciones bidireccionales en vivo, diseñado para asistentes que deben seguir el ritmo de un hablante en lugar de leer un guion preparado. Es el modelo versionado detrás del alias grok-voice-latest. Utilice este ID exacto cuando un producto requiera una versión de modelo fija para sus respuestas habladas.

Puntos fuertes

  • Es la versión fija y numerada detrás del alias de agente de voz de xAI, por lo que el comportamiento permanece vinculado a un modelo hasta que usted decida cambiarlo.
  • La detección de actividad de voz en el lado del servidor gestiona los turnos de palabra, por lo que el cliente transmite el audio del micrófono sin necesidad de su propia lógica de pausa.
  • Las instrucciones por respuesta permiten que una sesión cambie el prompt del sistema para una sola réplica, por ejemplo, para cambiar el tono durante la explicación de un reembolso.
  • Los reemplazos de pronunciación corrigen cómo se dicen los nombres y términos de productos sin alterar la transcripción.

Cuándo buscar otra opción

  • Es un modelo conversacional de voz a voz, por lo que la transcripción por lotes de archivos y la narración de textos largos se gestionan mejor con los modelos de voz dedicados.
  • Mantener una conexión abierta para audio en vivo requiere un cliente WebSocket; una llamada simple de solicitud y respuesta no será suficiente.

Primeros pasos

  1. Crear clave API

    Genera una clave en Console y úsala con cualquier modelo de la plataforma.

  2. Envía tu primera solicitud

    Copia el ejemplo para tu lenguaje y ejecútalo contra el endpoint.

    AudioChat Completions API
    POST/v1/chat/completions
    curl https://api.tokenlab.sh/v1/chat/completions \
      -H "Content-Type: application/json" \
      -H "Authorization: Bearer sk-xxx" \
      -d '{
        "model": "grok-voice-think-fast-2.0",
        "messages": [
          {"role": "user", "content": "Hello!"}
        ]
      }'

Precios

El precio oficial es la línea base pública del creador del modelo. El precio de TokenLab es lo que pagas por este modelo en TokenLab.

Audio Duration

por segundo
Precio Official
$0.001333
Official
$0.001333
Descuento
—

Uso y actividad

La tasa de éxito es la proporción de solicitudes completadas. La latencia es cuánto tarda una respuesta completa; P95 significa que el 95 % de las solicitudes terminaron dentro de ese tiempo.

Uso y disponibilidad

Últimas 24 horas
Solicitudes
Tasa de éxito
Latencia P95
Total de tokens
Desempeño del modelo
Las métricas aparecerán una vez que se alcancen los umbrales de privacidad y volumen de datos.

Los datos se basan en solicitudes de usuario agregadas, excluyendo las comprobaciones de estado.

Casos de uso

  • Reemplazo de respuesta de voz interactiva (IVR)

    Reemplace los menús telefónicos basados en opciones por un interlocutor que simplemente expone el problema, mientras el agente transfiere la llamada o la resuelve.

  • Compañero de práctica de idiomas

    Mantenga un diálogo hablado en un idioma objetivo, corrigiendo errores en voz alta y ajustando la velocidad cuando el estudiante lo solicite.

  • Asistente de campo manos libres

    Permita que un técnico haga preguntas sobre un manual mediante voz y escuche las respuestas mientras mantiene ambas manos ocupadas en el equipo.

Ejemplos de prompts

Eres un agente de soporte tranquilo de un proveedor de internet. Solicita el código postal de la cuenta y luego guía al interlocutor para reiniciar el router.

Pronuncia nuestra marca 'Zyntra' como ZIN-tra, mantén un tono amable y nunca interrumpas al interlocutor a mitad de una frase.

Actúa como un tutor de portugués. Habla despacio, repite mi frase corregida y haz una pregunta de seguimiento en cada turno.

FAQ

¿Cuál es la diferencia entre grok-voice-think-fast-2.0 y grok-voice-latest?

grok-voice-think-fast-2.0 es una versión específica del modelo, mientras que grok-voice-latest es un alias que actualmente apunta a ella. El alias cambiará a versiones más recientes; el nombre con fecha permanece en la versión que usted probó.

¿Es Grok Voice Think Fast 2.0 un modelo de texto a voz?

No. Escucha y responde en una sesión en vivo, recibiendo audio y produciendo respuestas habladas. Para convertir texto preparado en audio, utilice Grok Voice TTS; para transcribir grabaciones, utilice Grok Voice STT.

¿Cómo decide cuándo he terminado de hablar?

Las sesiones pueden habilitar la detección de actividad de voz en el servidor, la cual detecta el final del turno del usuario e inicia la respuesta. También puede gestionar los turnos usted mismo si su cliente ya cuenta con la función de pulsar para hablar (push-to-talk).

¿Qué voces puede utilizar?

Una sesión puede elegir entre las voces integradas de xAI, con 'eve' como predeterminada, o una voz personalizada clonada a partir de una grabación de referencia corta. Las voces integradas hablan todos los idiomas compatibles.

¿Cuánto cuesta Grok Voice Think Fast 2.0?

En TokenLab, Grok Voice Think Fast 2.0 cuesta $0.001333 por segundo. La tabla de precios arriba muestra el desglose completo. Las tarifas dependen de la unidad de facturación, la especificación y el uso. Compare condiciones iguales en el precio detallado del modelo; una sola tarifa no determina el coste total.

¿Qué endpoint debe usar Grok Voice Think Fast 2.0?

Utiliza https://api.tokenlab.sh/v1/chat/completions para Grok Voice Think Fast 2.0. El ejemplo de solicitud a continuación muestra la estructura de código correspondiente.

Comparar Grok Voice Think Fast 2.0

Fuentes

Revisado el 2 oct 2026

Más de Grok Voice

Modelos relacionados