音频与实时

创建翻译

将音频翻译为英文文本

POST
/v1/audio/translations

概述

把音频翻译成英文文本。无论输入是什么语言,结果都为英文。

本接口将音频翻译为英文。不要发送 language;音频翻译不支持此参数,可能返回 unsupported_parameter。文本翻译请使用 POST /v1/translations;recommended_for=translation 指向该文本接口。

请求体

翻译处理完成后返回。音频较长时,请将 HTTP 客户端超时设为至少 120s。

filefile必填

要翻译的音频文件。支持的格式:flac、mp3、mp4、mpeg、mpga、m4a、ogg、wav、webm。最大文件大小为 25 MB。

modelstring默认值: whisper-1

音频翻译模型 ID,例如 whisper-1。请在当前模型详情中确认其支持 POST /v1/audio/translations。

promptstring

可选的英文提示词,可补充专有名词、上下文或期望的文字风格。

response_formatstring默认值: json

输出格式。Whisper 支持 json、text、srt、verbose_json 和 vtt;其他模型支持的范围可能不同,请查询模型详情。

temperaturenumber

采样温度,范围为 0–1,仅适用于支持此参数的模型。

响应

以下字段用于 JSON 转录或翻译响应。text、srt 和 vtt 返回原始文本或字幕,而不是 JSON 对象。附加字段取决于模型和输出格式。

textstring

英文翻译文本。

对于 verbose_json 格式,响应还包括:

languagestring

响应提供的语言标记,仅在返回时存在。

durationnumber

输入音频的时长,单位为秒。

segmentsarray

带时间戳的翻译文本分段。

请求

curl -X POST "https://api.tokenlab.sh/v1/audio/translations" \
  -H "Authorization: Bearer sk-your-api-key" \
  -F "file=@german_audio.mp3" \
  -F "model=whisper-1"

响应

{
  "text": "Hello, my name is Wolfgang and I come from Germany. Where are you from?"
}

翻译与转录

功能翻译转录
输出语言始终为英文与输入相同
使用场景将外语音频转换为英文保留原始语言
language 参数不适用可选提示

授权

BearerAuth
AuthorizationBearer <token>

API Key 身份验证。在 Dashboard > API > API Keys 中创建或管理 API Key。

位置: header

请求头

X-TokenLab-Delivery-Policy?string

单次请求的交付策略。覆盖 API 密钥和 Workspace 的默认设置。自动优先尝试 TokenLab Verified,并在输出、请求接受或持久资源创建之前,可能会切换一次至仅限 Official。

可选值

  • "auto"
  • "verified"
  • "official"

请求体

multipart/form-data

响应

application/json

application/json

application/json

application/json

application/json

application/json