Escolha Auto, TokenLab Verified ou Official para cada solicitação, com preços exibidos antecipadamente.Veja as novidades

xAI: Grok Voice STT

O Grok Voice STT converte áudio gravado em texto. Dicas de idioma e controles de carimbo de data/hora o tornam útil para transcrições que alimentarão legendas, pesquisas ou uma etapa posterior de análise de texto.
Comparar modelos
grok-voice-stt
DisponívelxAIFala para TextoSíncrono
Preço
A partir de $0.000028
Modalidades
Áudio

Sobre o Grok Voice STT

Grok Voice STT é o modelo de conversão de fala em texto da xAI, transformando áudio gravado ou transmitido em transcrições de texto. Ele aceita formatos comuns de arquivos de áudio, retorna marcas de tempo (timestamps) em nível de palavra, pode separar falantes e canais, e formata números e moedas por idioma. Use-o para legendas, registros de reuniões pesquisáveis e transcrições de chamadas que alimentam análises de texto posteriores.

Pontos fortes

  • Marcas de tempo em nível de palavra tornam direto criar legendas, busca de salto para o momento específico e arquivos de legendas a partir da transcrição.
  • Diarização de falantes e transcrição multicanal separam quem disse o quê em reuniões e gravações de chamadas bidirecionais.
  • Dicas de idioma e uma lista de termos-chave personalizados direcionam o reconhecimento para nomes de produtos e jargões.
  • A formatação de texto renderiza números, datas e moedas da forma como a língua falada os escreve.

Quando usar outro modelo

  • Ele produz apenas transcrições; resumir, traduzir ou responder a partir do áudio requer um modelo de texto após ele.
  • Gravações muito ruidosas podem exigir que o limiar (threshold) de detecção de voz seja ajustado ou que a entrada seja mais limpa antes que a precisão seja aceitável.

Primeiros passos

  1. Criar chave de API

    Crie uma chave no Console e use com qualquer modelo da plataforma.

  2. Envie sua primeira requisição

    Copie o exemplo para sua linguagem e execute-o no endpoint.

    Fala para textoEndpoint do TokenLab
    POST/v1/audio/transcriptions
    curl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \
      -H "Authorization: Bearer sk-xxx" \
      -F file="@audio.mp3" \
      -F operation="stt" \
      -F response_format="json" \
      -F model="grok-voice-stt" \
      -F language="en"

Preço

O preço oficial é a base pública do criador do modelo. O preço TokenLab é o que você paga por este modelo na TokenLab.

Preço

por segundo
Official
$0.000028por segundo
Preço oficial
$0.000028por segundo

Uso e atividade

A taxa de sucesso é a proporção de requisições concluídas. A latência é quanto tempo uma resposta completa leva; P95 significa que 95% das requisições terminaram dentro desse tempo.

Uso e disponibilidade

Últimas 24 horas
Requisições
Taxa de sucesso
Latência P95
Total de tokens
Desempenho do modelo
As métricas aparecerão assim que os limites de privacidade e volume de dados forem atingidos.

Os dados baseiam-se em solicitações agregadas de usuários, excluindo verificações de status.

Abrir no Console

Abra Grok Voice STT no Console com um prompt pronto para editar ou enviar.

Ajude-me a testar grok-voice-stt com uma solicitação de áudio em /v1/audio/transcriptions. Exiba o resultado e custo.

Casos de uso

  • Transcrições de reuniões

    Transcrever uma chamada gravada com os falantes identificados e, em seguida, passar o texto para um resumidor para itens de ação.

  • Legendas para vídeo

    Gerar legendas com marcação de tempo a partir da faixa de áudio de um vídeo enviado usando as cronometragens de palavras.

  • Revisão de qualidade de central de atendimento (call center)

    Transcrever gravações de dois canais com o atendente e o cliente em canais separados, e então escanear em busca de frases de conformidade.

Exemplos de prompt

Transcreva este episódio de podcast de 45 minutos em inglês com marcas de tempo de palavras e falantes identificados.

Transcreva a chamada de cliente em anexo, usando os termos-chave 'Zyntra', 'OmniPlan' e 'SLA' para orientar o reconhecimento.

Converta este memorando de voz em espanhol para texto e formate os valores como moeda.

FAQ

O que o Grok Voice STT faz?

Ele converte áudio em texto. Você envia um arquivo ou transmite áudio, e ele retorna uma transcrição que pode incluir marcas de tempo em nível de palavra, rótulos de falantes e texto por canal, dependendo das opções que você definir.

Quais formatos de áudio ele consegue ler?

A xAI lista doze formatos, incluindo MP3, WAV, FLAC e Opus, com um limite máximo de tamanho de arquivo de 500 MB. Áudios PCM brutos (raw), mu-law e A-law exigem parâmetros de codificação explícitos.

Ele suporta transcrição ao vivo?

Sim. Um endpoint WebSocket transmite resultados intermediários e usa detecção de fim de turno Smart Turn para diferenciar pausas naturais do fim de uma frase, o que reduz cortes prematuros.

Quantos idiomas ele cobre?

A xAI documenta mais de 25 idiomas para transcrição e formatação específica de idioma. Passe uma dica de idioma quando souber qual é, para que o reconhecimento não precise adivinhar.

Ele consegue distinguir falantes?

Sim, a diarização rotula os falantes dentro de uma gravação, e o modo multicanal lida com até oito canais separados, o que se adapta a gravações de chamadas com uma parte por canal.

Quanto custa o Grok Voice STT?

No TokenLab, Grok Voice STT custa $0.000028 por segundo. A tabela de preços acima mostra o detalhamento completo.

Qual endpoint o Grok Voice STT deve usar?

Use https://api.tokenlab.sh/v1/audio/transcriptions para Grok Voice STT. O exemplo de requisição abaixo mostra o formato de código correspondente.

Quais operações o Grok Voice STT suporta?

Grok Voice STT suporta Fala para texto. Selecione uma operação acima para ver seu endpoint e exemplo de requisição.

Comparar Grok Voice STT

Fontes

Revisado em 2 de out. de 2026

Mais da série Grok Voice

Modelos relacionados