Áudio e tempo real
Criar Transcrição
Transcreve áudio para o idioma de entrada
Corpo da Requisição
A transcrição pode retornar o texto diretamente ou aceitar uma tarefa assíncrona com HTTP 200, id e status. Para uma tarefa aceita, siga poll_url ou consulte /v1/tasks/{id}. Para áudios longos processados de forma síncrona, permita pelo menos 120s de espera.
Arquivo de áudio para transcrever. Formatos suportados: flac, mp3, mp4, mpeg, mpga, m4a, ogg, wav, webm. Tamanho máximo do arquivo: 25 MB.
whisper-1ID do modelo de transcrição, como whisper-1 ou gpt-4o-transcribe. Consulte as opções atuais com GET /v1/models?recommended_for=stt.
Idioma do áudio no formato ISO-639-1 (por exemplo, en, zh, ja).
Texto opcional para orientar o estilo do modelo ou continuar um segmento anterior.
jsonFormato de saída. Whisper aceita json, text, srt, verbose_json e vtt; outros modelos podem aceitar um conjunto diferente. Consulte os detalhes do modelo.
Temperatura de amostragem de 0 a 1, apenas para modelos que aceitam esse parâmetro.
word e/ou segment, se aceitos pelo modelo. Whisper exige response_format=verbose_json. Em multipart, repita timestamp_granularities[] para enviar vários valores.
Resposta
Os campos abaixo descrevem respostas JSON de transcrição ou tradução. text, srt e vtt retornam texto ou legendas sem um objeto JSON. Campos adicionais dependem do modelo e do formato.
O texto transcrito.
Para verbose_json:
Nome da tarefa quando retornado, como transcribe.
Idioma detectado.
Duração do áudio em segundos.
Segmentos da transcrição com timestamps.
Timestamps em nível de palavra (se solicitado).
Uma tarefa assíncrona de transcrição aceita retorna os campos abaixo em vez do texto:
ID da tarefa.
Alias do identificador da tarefa assíncrona quando disponível.
Status da tarefa: pending, processing, completed ou failed.
URL de polling preferencial quando a resposta de criação a fornece.
Requisição
curl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \
-H "Authorization: Bearer sk-your-api-key" \
-F file="@audio.mp3" \
-F model="whisper-1" \
-F language="en"Resposta
{
"text": "Hello, this is a test of the transcription API."
}Tradução
Para traduzir áudio para o inglês, use o endpoint de translations:
with open("audio.mp3", "rb") as audio_file:
response = client.audio.translations.create(
model="whisper-1",
file=audio_file
)
print(response.text)Autorização
BearerAuth Autenticação por Chave de API. Crie ou gerencie chaves de API em Dashboard > API > API Keys.
Local: header
Cabeçalhos
Política de entrega por solicitação. Substitui os padrões da API key e do Workspace. Tenta automaticamente o TokenLab Verified primeiro e pode alternar uma vez para Official apenas antes da saída, aceitação da solicitação ou criação de recurso persistente.
Valores permitidos
- "auto"
- "verified"
- "official"
Corpo da requisição
multipart/form-data
Resposta
application/json
application/json
application/json
application/json
application/json
application/json