音訊與即時
建立翻譯
將音訊翻譯為英文文字
概覽
將任何支援語言的音訊翻譯為英文文字。不同於轉錄,無論輸入語言為何,此端點一律輸出英文文字。
本端點將音訊翻譯為英文。請勿傳送 language;音訊翻譯不支援此參數,可能回傳 unsupported_parameter。文字翻譯請使用 POST /v1/translations;recommended_for=translation 指向該文字端點。
請求本文
翻譯處理完成後回傳。音訊較長時,請將 HTTP 用戶端逾時設為至少 120s。
要翻譯的音訊檔案。支援的格式:flac、mp3、mp4、mpeg、mpga、m4a、ogg、wav、webm。檔案大小上限為 25 MB。
whisper-1音訊翻譯模型 ID,例如 whisper-1。請在目前模型詳情中確認其支援 POST /v1/audio/translations。
用於引導模型風格或延續前一段內容的選用文字。應以英文撰寫。
json輸出格式。Whisper 支援 json、text、srt、verbose_json 和 vtt;其他模型支援的範圍可能不同,請查詢模型詳情。
取樣溫度,範圍為 0–1,僅適用於支援此參數的模型。
回應
以下欄位用於 JSON 轉錄或翻譯回應。text、srt 和 vtt 回傳原始文字或字幕,而不是 JSON 物件。附加欄位取決於模型和輸出格式。
英文翻譯文字。
對於 verbose_json 格式,回應還包括:
回應提供的語言標記,僅在回傳時存在。
輸入音訊的長度(秒)。
帶有時間戳記的翻譯文字分段。
請求
curl -X POST "https://api.tokenlab.sh/v1/audio/translations" \
-H "Authorization: Bearer sk-your-api-key" \
-F "file=@german_audio.mp3" \
-F "model=whisper-1"回應
{
"text": "Hello, my name is Wolfgang and I come from Germany. Where are you from?"
}翻譯與轉錄的差異
| 功能 | 翻譯 | 轉錄 |
|---|---|---|
| 輸出語言 | 一律為英文 | 與輸入相同 |
| 使用情境 | 將外語音訊轉為英文 | 保留原始語言 |
| 語言參數 | 不適用 | 可選提示 |
授權
BearerAuth API Key 驗證。請在 Dashboard > API > API Keys 建立或管理 API 金鑰。
位置: header
請求標頭
單次請求傳遞策略。會覆寫 API key 與 Workspace 的預設值。系統會自動優先嘗試 TokenLab Verified,並可能在輸出、請求接受或建立持久性資源前切換至 Official 模式一次。
可選值
- "auto"
- "verified"
- "official"
請求主體
multipart/form-data
回應
application/json
application/json
application/json
application/json
application/json
application/json