Elija Auto, TokenLab Verified o Official para cada solicitud, con los precios mostrados por adelantado.Ver las novedades

xAI: Grok Voice STT

Grok Voice STT convierte audio grabado en texto. Las sugerencias de idioma y los controles de marca de tiempo lo hacen útil para transcripciones que alimentarán subtítulos, búsquedas o un paso posterior de análisis de texto.
Comparar modelos
grok-voice-stt
DisponiblexAIVoz a textoSíncrono
Precio
Desde $0.000028
Modalidades
Audio

Sobre Grok Voice STT

Grok Voice STT es el modelo de voz a texto de xAI, que convierte audio grabado o transmitido en transcripciones de texto. Acepta formatos de archivo de audio comunes, devuelve marcas de tiempo a nivel de palabra, puede separar hablantes y canales, y formatea números y divisas según el idioma. Úselo para subtítulos, registros de reuniones con capacidad de búsqueda y transcripciones de llamadas que alimenten análisis de texto posteriores.

Puntos fuertes

  • Las marcas de tiempo a nivel de palabra facilitan la creación de subtítulos, la búsqueda de momentos específicos y archivos de subtítulos a partir de la transcripción.
  • La diarización de hablantes y la transcripción multicanal separan quién dijo qué en reuniones y grabaciones de llamadas bidireccionales.
  • Las sugerencias de idioma y una lista de términos clave personalizados orientan el reconocimiento hacia nombres de productos y jerga.
  • El formato de texto representa números, fechas y divisas tal como se escriben en el idioma hablado.

Cuándo buscar otra opción

  • Solo produce transcripciones; para resumir, traducir o responder a partir del audio, se necesita un modelo de texto posterior.
  • Las grabaciones con mucho ruido pueden requerir ajustar el umbral de detección de voz o una entrada más limpia antes de que la precisión sea aceptable.

Primeros pasos

  1. Crear clave API

    Genera una clave en Console y úsala con cualquier modelo de la plataforma.

  2. Envía tu primera solicitud

    Copia el ejemplo para tu lenguaje y ejecútalo contra el endpoint.

    Voz a textoEndpoint de TokenLab
    POST/v1/audio/transcriptions
    curl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \
      -H "Authorization: Bearer sk-xxx" \
      -F file="@audio.mp3" \
      -F operation="stt" \
      -F response_format="json" \
      -F model="grok-voice-stt" \
      -F language="en"

Precios

El precio oficial es la línea base pública del creador del modelo. El precio de TokenLab es lo que pagas por este modelo en TokenLab.

Precios

por segundo
Official
$0.000028por segundo
Precio Official
$0.000028por segundo

Uso y actividad

La tasa de éxito es la proporción de solicitudes completadas. La latencia es cuánto tarda una respuesta completa; P95 significa que el 95 % de las solicitudes terminaron dentro de ese tiempo.

Uso y disponibilidad

Últimas 24 horas
Solicitudes
Tasa de éxito
Latencia P95
Total de tokens
Desempeño del modelo
Las métricas aparecerán una vez que se alcancen los umbrales de privacidad y volumen de datos.

Los datos se basan en solicitudes de usuario agregadas, excluyendo las comprobaciones de estado.

Abrir en Console

Abre Grok Voice STT en Console con un prompt listo para editar o enviar.

Ayúdame a probar grok-voice-stt con una solicitud de audio breve en /v1/audio/transcriptions. Muestra el resultado y el coste.

Casos de uso

  • Transcripciones de reuniones

    Transcribir una llamada grabada con los hablantes etiquetados, luego pasar el texto a un resumidor para obtener los puntos de acción.

  • Subtítulos para video

    Generar subtítulos temporizados a partir de la pista de audio de un video cargado utilizando los tiempos de las palabras.

  • Revisión de calidad de centros de llamadas

    Transcribir grabaciones de dos canales con el agente y el cliente en canales separados, luego buscar frases de cumplimiento.

Ejemplos de prompts

Transcribe este episodio de podcast de 45 minutos en inglés con marcas de tiempo de palabras y hablantes etiquetados.

Transcribe la llamada del cliente adjunta, utilizando los términos clave 'Zyntra', 'OmniPlan' y 'SLA' para sesgar el reconocimiento.

Convierte esta nota de voz en español a texto y formatea las cantidades como moneda.

FAQ

¿Qué hace Grok Voice STT?

Convierte audio en texto. Envías un archivo o transmites audio, y devuelve una transcripción que puede incluir marcas de tiempo a nivel de palabra, etiquetas de hablante y texto por canal, dependiendo de las opciones que establezcas.

¿Qué formatos de audio puede leer?

xAI enumera doce formatos, incluidos MP3, WAV, FLAC y Opus, con un límite de tamaño de archivo de 500 MB. El audio PCM, mu-law y A-law sin procesar requiere parámetros de codificación explícitos.

¿Admite transcripción en vivo?

Sí. Un endpoint WebSocket transmite resultados provisionales y utiliza la detección de fin de turno Smart Turn para distinguir las pausas naturales del final de una frase, lo que reduce los cortes prematuros.

¿Cuántos idiomas cubre?

xAI documenta más de 25 idiomas para la transcripción y el formato específico del idioma. Pase una sugerencia de idioma cuando conozca el idioma, para que el reconocimiento no tenga que adivinar.

¿Puede distinguir a los hablantes?

Sí, la diarización etiqueta a los hablantes dentro de una grabación, y el modo multicanal maneja hasta ocho canales separados, lo cual es adecuado para grabaciones de llamadas con una parte por canal.

¿Cuánto cuesta Grok Voice STT?

En TokenLab, Grok Voice STT cuesta $0.000028 por segundo. La tabla de precios arriba muestra el desglose completo.

¿Qué endpoint debe usar Grok Voice STT?

Utiliza https://api.tokenlab.sh/v1/audio/transcriptions para Grok Voice STT. El ejemplo de solicitud a continuación muestra la estructura de código correspondiente.

¿Qué operaciones soporta Grok Voice STT?

Grok Voice STT admite Voz a texto. Selecciona una operación arriba para ver su endpoint y ejemplo de solicitud.

Comparar Grok Voice STT

Fuentes

Revisado el 2 oct 2026

Más de Grok Voice

Modelos relacionados