xAI: Grok Voice STT
grok-voice-stt- Preço
- A partir de $0.000028
- Modalidades
- Áudio
Sobre o Grok Voice STT
Grok Voice STT é o modelo de conversão de fala em texto da xAI, transformando áudio gravado ou transmitido em transcrições de texto. Ele aceita formatos comuns de arquivos de áudio, retorna marcas de tempo (timestamps) em nível de palavra, pode separar falantes e canais, e formata números e moedas por idioma. Use-o para legendas, registros de reuniões pesquisáveis e transcrições de chamadas que alimentam análises de texto posteriores.
Pontos fortes
- Marcas de tempo em nível de palavra tornam direto criar legendas, busca de salto para o momento específico e arquivos de legendas a partir da transcrição.
- Diarização de falantes e transcrição multicanal separam quem disse o quê em reuniões e gravações de chamadas bidirecionais.
- Dicas de idioma e uma lista de termos-chave personalizados direcionam o reconhecimento para nomes de produtos e jargões.
- A formatação de texto renderiza números, datas e moedas da forma como a língua falada os escreve.
Quando usar outro modelo
- Ele produz apenas transcrições; resumir, traduzir ou responder a partir do áudio requer um modelo de texto após ele.
- Gravações muito ruidosas podem exigir que o limiar (threshold) de detecção de voz seja ajustado ou que a entrada seja mais limpa antes que a precisão seja aceitável.
Primeiros passos
Criar chave de API
Crie uma chave no Console e use com qualquer modelo da plataforma.
Envie sua primeira requisição
Copie o exemplo para sua linguagem e execute-o no endpoint.
Fala para textoEndpoint do TokenLabPOST/v1/audio/transcriptionscurl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \ -H "Authorization: Bearer sk-xxx" \ -F file="@audio.mp3" \ -F operation="stt" \ -F response_format="json" \ -F model="grok-voice-stt" \ -F language="en"
Preço
O preço oficial é a base pública do criador do modelo. O preço TokenLab é o que você paga por este modelo na TokenLab.
Preço
por segundo- Official
- $0.000028por segundo
- Preço oficial
- $0.000028por segundo
| Preço oficialpor segundo | Officialpor segundo | Desconto | |
|---|---|---|---|
| Preço | $0.000028por segundo | $0.000028por segundo | — |
Uso e atividade
A taxa de sucesso é a proporção de requisições concluídas. A latência é quanto tempo uma resposta completa leva; P95 significa que 95% das requisições terminaram dentro desse tempo.
Uso e disponibilidade
Últimas 24 horas- Requisições
- Taxa de sucesso
- Latência P95
- Total de tokens
Os dados baseiam-se em solicitações agregadas de usuários, excluindo verificações de status.
Abrir no Console
Abra Grok Voice STT no Console com um prompt pronto para editar ou enviar.
Ajude-me a testar grok-voice-stt com uma solicitação de áudio em /v1/audio/transcriptions. Exiba o resultado e custo.
Casos de uso
Transcrições de reuniões
Transcrever uma chamada gravada com os falantes identificados e, em seguida, passar o texto para um resumidor para itens de ação.
Legendas para vídeo
Gerar legendas com marcação de tempo a partir da faixa de áudio de um vídeo enviado usando as cronometragens de palavras.
Revisão de qualidade de central de atendimento (call center)
Transcrever gravações de dois canais com o atendente e o cliente em canais separados, e então escanear em busca de frases de conformidade.
Exemplos de prompt
Transcreva este episódio de podcast de 45 minutos em inglês com marcas de tempo de palavras e falantes identificados.
Transcreva a chamada de cliente em anexo, usando os termos-chave 'Zyntra', 'OmniPlan' e 'SLA' para orientar o reconhecimento.
Converta este memorando de voz em espanhol para texto e formate os valores como moeda.
FAQ
O que o Grok Voice STT faz?
Ele converte áudio em texto. Você envia um arquivo ou transmite áudio, e ele retorna uma transcrição que pode incluir marcas de tempo em nível de palavra, rótulos de falantes e texto por canal, dependendo das opções que você definir.
Quais formatos de áudio ele consegue ler?
A xAI lista doze formatos, incluindo MP3, WAV, FLAC e Opus, com um limite máximo de tamanho de arquivo de 500 MB. Áudios PCM brutos (raw), mu-law e A-law exigem parâmetros de codificação explícitos.
Ele suporta transcrição ao vivo?
Sim. Um endpoint WebSocket transmite resultados intermediários e usa detecção de fim de turno Smart Turn para diferenciar pausas naturais do fim de uma frase, o que reduz cortes prematuros.
Quantos idiomas ele cobre?
A xAI documenta mais de 25 idiomas para transcrição e formatação específica de idioma. Passe uma dica de idioma quando souber qual é, para que o reconhecimento não precise adivinhar.
Ele consegue distinguir falantes?
Sim, a diarização rotula os falantes dentro de uma gravação, e o modo multicanal lida com até oito canais separados, o que se adapta a gravações de chamadas com uma parte por canal.
Quanto custa o Grok Voice STT?
No TokenLab, Grok Voice STT custa $0.000028 por segundo. A tabela de preços acima mostra o detalhamento completo.
Qual endpoint o Grok Voice STT deve usar?
Use https://api.tokenlab.sh/v1/audio/transcriptions para Grok Voice STT. O exemplo de requisição abaixo mostra o formato de código correspondente.
Quais operações o Grok Voice STT suporta?
Grok Voice STT suporta Fala para texto. Selecione uma operação acima para ver seu endpoint e exemplo de requisição.
Comparar Grok Voice STT
Fontes
Revisado em 2 de out. de 2026