TokenLab

音訊與即時

建立翻譯

將音訊翻譯為英文文字

POST
/v1/audio/translations

概覽

將任何支援語言的音訊翻譯為英文文字。不同於轉錄,無論輸入語言為何,此端點一律輸出英文文字。

本端點將音訊翻譯為英文。請勿傳送 language;音訊翻譯不支援此參數,可能回傳 unsupported_parameter。文字翻譯請使用 POST /v1/translations;recommended_for=translation 指向該文字端點。

請求本文

翻譯處理完成後回傳。音訊較長時,請將 HTTP 用戶端逾時設為至少 120s。

filefile必填

要翻譯的音訊檔案。支援的格式:flac、mp3、mp4、mpeg、mpga、m4a、ogg、wav、webm。檔案大小上限為 25 MB。

modelstring預設值: whisper-1

音訊翻譯模型 ID,例如 whisper-1。請在目前模型詳情中確認其支援 POST /v1/audio/translations。

promptstring

用於引導模型風格或延續前一段內容的選用文字。應以英文撰寫。

response_formatstring預設值: json

輸出格式。Whisper 支援 json、text、srt、verbose_json 和 vtt;其他模型支援的範圍可能不同,請查詢模型詳情。

temperaturenumber

取樣溫度,範圍為 0–1,僅適用於支援此參數的模型。

回應

以下欄位用於 JSON 轉錄或翻譯回應。text、srt 和 vtt 回傳原始文字或字幕,而不是 JSON 物件。附加欄位取決於模型和輸出格式。

textstring

英文翻譯文字。

對於 verbose_json 格式,回應還包括:

languagestring

回應提供的語言標記,僅在回傳時存在。

durationnumber

輸入音訊的長度(秒)。

segmentsarray

帶有時間戳記的翻譯文字分段。

請求

curl -X POST "https://api.tokenlab.sh/v1/audio/translations" \
  -H "Authorization: Bearer sk-your-api-key" \
  -F "file=@german_audio.mp3" \
  -F "model=whisper-1"

回應

{
  "text": "Hello, my name is Wolfgang and I come from Germany. Where are you from?"
}

翻譯與轉錄的差異

功能翻譯轉錄
輸出語言一律為英文與輸入相同
使用情境將外語音訊轉為英文保留原始語言
語言參數不適用可選提示

授權

BearerAuth
AuthorizationBearer <token>

API Key 驗證。請在 Dashboard > API > API Keys 建立或管理 API 金鑰。

位置: header

請求標頭

X-TokenLab-Delivery-Policy?string

單次請求傳遞策略。會覆寫 API key 與 Workspace 的預設值。系統會自動優先嘗試 TokenLab Verified,並可能在輸出、請求接受或建立持久性資源前切換至 Official 模式一次。

可選值

  • "auto"
  • "verified"
  • "official"

請求主體

multipart/form-data

回應

application/json

application/json

application/json

application/json

application/json

application/json