Elija Auto, TokenLab Verified o Official para cada solicitud, con los precios mostrados por adelantado.Ver las novedades

xAI: Grok STT

Grok STT es el servicio de voz a texto de xAI para grabaciones cargadas. Esta integración expone la transcripción por lotes con la duración del audio reportada; el servicio de transmisión en tiempo real utiliza una interfaz y un contrato de precios independientes.
Comparar modelos
grok-stt
DisponiblexAIVoz a textoSíncrono
Precio
Desde $0.000028
Modalidades
Audio

Sobre Grok STT

Grok STT es el servicio de voz a texto de xAI para convertir audio grabado en texto. Este modelo procesa grabaciones subidas en lote y devuelve la transcripción en formato JSON. xAI documenta soporte para 25 idiomas en su servicio de transcripción. La transcripción en tiempo real mediante streaming es una interfaz de xAI independiente, por lo que este modelo es adecuado para archivos que ya existen, como reuniones, llamadas y entrevistas.

Puntos fuertes

  • Transcribe archivos de audio subidos en una sola solicitud y devuelve un resultado en JSON.
  • xAI documenta soporte para 25 idiomas, cubriendo muchas grabaciones multilingües.
  • Se adapta a trabajos por lotes como archivos de reuniones, grabaciones de llamadas y registros de entrevistas.
  • Funciona mediante el formato estándar de solicitud de transcripción de audio, por lo que los clientes existentes de estilo Whisper requieren pocos cambios.
  • Las grabaciones largas se manejan como una sola carga de archivo en lugar de dividirse en fragmentos cortos.

Cuándo buscar otra opción

  • Solo por lotes; los subtítulos en vivo y el streaming de baja latencia requieren una interfaz de tiempo real independiente.
  • La salida es una transcripción en JSON, sin funciones integradas de resumen o traducción.
  • La precisión depende de la calidad del audio, por lo que el habla con ruido o superpuesta puede requerir limpieza o revisión.

Primeros pasos

  1. Crear clave API

    Genera una clave en Console y úsala con cualquier modelo de la plataforma.

  2. Envía tu primera solicitud

    Copia el ejemplo para tu lenguaje y ejecútalo contra el endpoint.

    Voz a textoEndpoint de TokenLab
    POST/v1/audio/transcriptions
    curl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \
      -H "Authorization: Bearer sk-xxx" \
      -F file="@audio.mp3" \
      -F operation="stt" \
      -F response_format="json" \
      -F model="grok-stt" \
      -F language="en"

Precios

El precio oficial es la línea base pública del creador del modelo. El precio de TokenLab es lo que pagas por este modelo en TokenLab.

Voz a texto

por segundo
Precio Official
$0.00002778
Official
$0.00002778
Descuento
—

Uso y actividad

La tasa de éxito es la proporción de solicitudes completadas. La latencia es cuánto tarda una respuesta completa; P95 significa que el 95 % de las solicitudes terminaron dentro de ese tiempo.

Uso y disponibilidad

Últimas 24 horas
Solicitudes
Tasa de éxito
Latencia P95
Total de tokens
Desempeño del modelo
Las métricas aparecerán una vez que se alcancen los umbrales de privacidad y volumen de datos.

Los datos se basan en solicitudes de usuario agregadas, excluyendo las comprobaciones de estado.

Abrir en Console

Abre Grok STT en Console con un prompt listo para editar o enviar.

Ayúdame a probar grok-stt con una solicitud de audio breve en /v1/audio/transcriptions. Muestra el resultado y el coste.

Casos de uso

  • Transcripciones de reuniones

    Suba llamadas o reuniones grabadas y almacene el texto para que los equipos puedan buscar en ellas o enviarlas a un modelo de resumen.

  • Archivos de entrevistas y podcasts

    Convierta un registro de grabaciones a texto para edición, citas y notas del programa.

  • Revisión de llamadas de soporte

    Transcriba llamadas de clientes de forma masiva para que los equipos de calidad puedan analizar problemas y temas.

Ejemplos de prompts

Transcribe esta grabación de reunión de equipo de 45 minutos en inglés.

Transcribe la llamada de cliente adjunta. Los hablantes hablan en español.

Convierte esta conferencia grabada a texto para que pueda buscar la sección sobre la fotosíntesis.

FAQ

¿Qué es Grok STT?

Es el servicio de voz a texto de xAI. Acepta una grabación subida y devuelve la transcripción en JSON, trabajando en modo por lotes en lugar de en vivo. Úselo para grabaciones que ya tiene, como reuniones, llamadas y entrevistas.

¿Qué idiomas admite?

xAI documenta 25 idiomas para su servicio de transcripción. Pruebe primero una muestra corta en su idioma, ya que la precisión varía según el idioma y la calidad de la grabación. Los acentos también afectan los resultados.

¿Puede Grok STT transcribir audio en vivo?

No. Solo maneja archivos subidos, así que úselo después de que una llamada o reunión haya terminado. xAI ofrece transcripción por streaming a través de una interfaz independiente, y los subtítulos en vivo requieren esa interfaz en lugar de este modelo.

¿Qué formato recibo?

Una respuesta JSON que contiene el texto de la transcripción. Puede pasar ese texto a un modelo de lenguaje para obtener resúmenes, elementos de acción o traducción a otro idioma.

¿En qué se diferencia de Whisper?

Ambos transcriben audio subido mediante el mismo estilo de solicitud. Difieren en la cobertura de idiomas y la precisión según el tipo de audio, así que ejecute ambos en una muestra de sus grabaciones y compare las transcripciones.

¿Cuánto cuesta Grok STT?

En TokenLab, Grok STT cuesta $0.00002778 por segundo. La tabla de precios arriba muestra el desglose completo. Las tarifas dependen de la unidad de facturación, la especificación y el uso. Compare condiciones iguales en el precio detallado del modelo; una sola tarifa no determina el coste total.

¿Qué endpoint debe usar Grok STT?

Utiliza https://api.tokenlab.sh/v1/audio/transcriptions para Grok STT. El ejemplo de solicitud a continuación muestra la estructura de código correspondiente.

¿Qué operaciones soporta Grok STT?

Grok STT admite Voz a texto. Selecciona una operación arriba para ver su endpoint y ejemplo de solicitud.

Comparar Grok STT

Fuentes

Revisado el 2 oct 2026

Más de Grok Voice

Modelos relacionados