xAI: Grok Voice STT
grok-voice-stt- Precio
- Desde $0.000028
- Modalidades
- Audio
Sobre Grok Voice STT
Grok Voice STT es el modelo de voz a texto de xAI, que convierte audio grabado o transmitido en transcripciones de texto. Acepta formatos de archivo de audio comunes, devuelve marcas de tiempo a nivel de palabra, puede separar hablantes y canales, y formatea números y divisas según el idioma. Úselo para subtítulos, registros de reuniones con capacidad de búsqueda y transcripciones de llamadas que alimenten análisis de texto posteriores.
Puntos fuertes
- Las marcas de tiempo a nivel de palabra facilitan la creación de subtítulos, la búsqueda de momentos específicos y archivos de subtítulos a partir de la transcripción.
- La diarización de hablantes y la transcripción multicanal separan quién dijo qué en reuniones y grabaciones de llamadas bidireccionales.
- Las sugerencias de idioma y una lista de términos clave personalizados orientan el reconocimiento hacia nombres de productos y jerga.
- El formato de texto representa números, fechas y divisas tal como se escriben en el idioma hablado.
Cuándo buscar otra opción
- Solo produce transcripciones; para resumir, traducir o responder a partir del audio, se necesita un modelo de texto posterior.
- Las grabaciones con mucho ruido pueden requerir ajustar el umbral de detección de voz o una entrada más limpia antes de que la precisión sea aceptable.
Primeros pasos
Crear clave API
Genera una clave en Console y úsala con cualquier modelo de la plataforma.
Envía tu primera solicitud
Copia el ejemplo para tu lenguaje y ejecútalo contra el endpoint.
Voz a textoEndpoint de TokenLabPOST/v1/audio/transcriptionscurl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \ -H "Authorization: Bearer sk-xxx" \ -F file="@audio.mp3" \ -F operation="stt" \ -F response_format="json" \ -F model="grok-voice-stt" \ -F language="en"
Precios
El precio oficial es la línea base pública del creador del modelo. El precio de TokenLab es lo que pagas por este modelo en TokenLab.
Precios
por segundo- Official
- $0.000028por segundo
- Precio Official
- $0.000028por segundo
| Precio Officialpor segundo | Officialpor segundo | Descuento | |
|---|---|---|---|
| Precio | $0.000028por segundo | $0.000028por segundo | — |
Uso y actividad
La tasa de éxito es la proporción de solicitudes completadas. La latencia es cuánto tarda una respuesta completa; P95 significa que el 95 % de las solicitudes terminaron dentro de ese tiempo.
Uso y disponibilidad
Últimas 24 horas- Solicitudes
- Tasa de éxito
- Latencia P95
- Total de tokens
Los datos se basan en solicitudes de usuario agregadas, excluyendo las comprobaciones de estado.
Abrir en Console
Abre Grok Voice STT en Console con un prompt listo para editar o enviar.
Ayúdame a probar grok-voice-stt con una solicitud de audio breve en /v1/audio/transcriptions. Muestra el resultado y el coste.
Casos de uso
Transcripciones de reuniones
Transcribir una llamada grabada con los hablantes etiquetados, luego pasar el texto a un resumidor para obtener los puntos de acción.
Subtítulos para video
Generar subtítulos temporizados a partir de la pista de audio de un video cargado utilizando los tiempos de las palabras.
Revisión de calidad de centros de llamadas
Transcribir grabaciones de dos canales con el agente y el cliente en canales separados, luego buscar frases de cumplimiento.
Ejemplos de prompts
Transcribe este episodio de podcast de 45 minutos en inglés con marcas de tiempo de palabras y hablantes etiquetados.
Transcribe la llamada del cliente adjunta, utilizando los términos clave 'Zyntra', 'OmniPlan' y 'SLA' para sesgar el reconocimiento.
Convierte esta nota de voz en español a texto y formatea las cantidades como moneda.
FAQ
¿Qué hace Grok Voice STT?
Convierte audio en texto. Envías un archivo o transmites audio, y devuelve una transcripción que puede incluir marcas de tiempo a nivel de palabra, etiquetas de hablante y texto por canal, dependiendo de las opciones que establezcas.
¿Qué formatos de audio puede leer?
xAI enumera doce formatos, incluidos MP3, WAV, FLAC y Opus, con un límite de tamaño de archivo de 500 MB. El audio PCM, mu-law y A-law sin procesar requiere parámetros de codificación explícitos.
¿Admite transcripción en vivo?
Sí. Un endpoint WebSocket transmite resultados provisionales y utiliza la detección de fin de turno Smart Turn para distinguir las pausas naturales del final de una frase, lo que reduce los cortes prematuros.
¿Cuántos idiomas cubre?
xAI documenta más de 25 idiomas para la transcripción y el formato específico del idioma. Pase una sugerencia de idioma cuando conozca el idioma, para que el reconocimiento no tenga que adivinar.
¿Puede distinguir a los hablantes?
Sí, la diarización etiqueta a los hablantes dentro de una grabación, y el modo multicanal maneja hasta ocho canales separados, lo cual es adecuado para grabaciones de llamadas con una parte por canal.
¿Cuánto cuesta Grok Voice STT?
En TokenLab, Grok Voice STT cuesta $0.000028 por segundo. La tabla de precios arriba muestra el desglose completo.
¿Qué endpoint debe usar Grok Voice STT?
Utiliza https://api.tokenlab.sh/v1/audio/transcriptions para Grok Voice STT. El ejemplo de solicitud a continuación muestra la estructura de código correspondiente.
¿Qué operaciones soporta Grok Voice STT?
Grok Voice STT admite Voz a texto. Selecciona una operación arriba para ver su endpoint y ejemplo de solicitud.
Comparar Grok Voice STT
Fuentes
Revisado el 2 oct 2026