Áudio e tempo real

Criar Transcrição

Transcreve áudio para o idioma de entrada

POST
/v1/audio/transcriptions

Corpo da Requisição

A transcrição pode retornar o texto diretamente ou aceitar uma tarefa assíncrona com HTTP 200, id e status. Para uma tarefa aceita, siga poll_url ou consulte /v1/tasks/{id}. Para áudios longos processados de forma síncrona, permita pelo menos 120s de espera.

filefileobrigatório

Arquivo de áudio para transcrever. Formatos suportados: flac, mp3, mp4, mpeg, mpga, m4a, ogg, wav, webm. Tamanho máximo do arquivo: 25 MB.

modelstringpadrão: whisper-1

ID do modelo de transcrição, como whisper-1 ou gpt-4o-transcribe. Consulte as opções atuais com GET /v1/models?recommended_for=stt.

languagestring

Idioma do áudio no formato ISO-639-1 (por exemplo, en, zh, ja).

promptstring

Texto opcional para orientar o estilo do modelo ou continuar um segmento anterior.

response_formatstringpadrão: json

Formato de saída. Whisper aceita json, text, srt, verbose_json e vtt; outros modelos podem aceitar um conjunto diferente. Consulte os detalhes do modelo.

temperaturenumber

Temperatura de amostragem de 0 a 1, apenas para modelos que aceitam esse parâmetro.

timestamp_granularitiesarray

word e/ou segment, se aceitos pelo modelo. Whisper exige response_format=verbose_json. Em multipart, repita timestamp_granularities[] para enviar vários valores.

Resposta

Os campos abaixo descrevem respostas JSON de transcrição ou tradução. text, srt e vtt retornam texto ou legendas sem um objeto JSON. Campos adicionais dependem do modelo e do formato.

textstring

O texto transcrito.

Para verbose_json:

taskstring

Nome da tarefa quando retornado, como transcribe.

languagestring

Idioma detectado.

durationnumber

Duração do áudio em segundos.

segmentsarray

Segmentos da transcrição com timestamps.

wordsarray

Timestamps em nível de palavra (se solicitado).

Uma tarefa assíncrona de transcrição aceita retorna os campos abaixo em vez do texto:

idstring

ID da tarefa.

task_idstring

Alias do identificador da tarefa assíncrona quando disponível.

statusstring

Status da tarefa: pending, processing, completed ou failed.

poll_urlstring

URL de polling preferencial quando a resposta de criação a fornece.

Requisição

curl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \
  -H "Authorization: Bearer sk-your-api-key" \
  -F file="@audio.mp3" \
  -F model="whisper-1" \
  -F language="en"

Resposta

{
  "text": "Hello, this is a test of the transcription API."
}

Tradução

Para traduzir áudio para o inglês, use o endpoint de translations:

with open("audio.mp3", "rb") as audio_file:
    response = client.audio.translations.create(
        model="whisper-1",
        file=audio_file
    )

print(response.text)

Autorização

BearerAuth
AuthorizationBearer <token>

Autenticação por Chave de API. Crie ou gerencie chaves de API em Dashboard > API > API Keys.

Local: header

Cabeçalhos

X-TokenLab-Delivery-Policy?string

Política de entrega por solicitação. Substitui os padrões da API key e do Workspace. Tenta automaticamente o TokenLab Verified primeiro e pode alternar uma vez para Official apenas antes da saída, aceitação da solicitação ou criação de recurso persistente.

Valores permitidos

  • "auto"
  • "verified"
  • "official"

Corpo da requisição

multipart/form-data

Resposta

application/json

application/json

application/json

application/json

application/json

application/json