音訊與即時
建立轉錄
將音訊轉錄為輸入語言
請求主體
轉錄可能直接回傳文字,也可能以 HTTP 200、id 和 status 回傳已接受的非同步任務。非同步任務請依 poll_url 查詢,或使用 /v1/tasks/{id}。同步處理較長音訊時,請將用戶端逾時設為至少 120s。
要轉錄的音訊檔案。支援格式:flac、mp3、mp4、mpeg、mpga、m4a、ogg、wav、webm。 檔案大小上限:25 MB。
whisper-1轉錄模型 ID,例如 whisper-1 或 gpt-4o-transcribe。透過 GET /v1/models?recommended_for=stt 取得目前可選模型。
音訊的語言,採用 ISO-639-1 格式(例如:en、zh、ja)。
可選文字,用於引導模型的風格或延續前一段內容。
json輸出格式。Whisper 支援 json、text、srt、verbose_json 和 vtt;其他模型支援的範圍可能不同,請查詢模型詳情。
取樣溫度,範圍為 0–1,僅適用於支援此參數的模型。
所選模型支援時,可指定 word 和/或 segment。Whisper 需要 response_format=verbose_json。multipart 請求中,多值應重複傳送 timestamp_granularities[]。
回應
以下欄位用於 JSON 轉錄或翻譯回應。text、srt 和 vtt 回傳原始文字或字幕,而不是 JSON 物件。附加欄位取決於模型和輸出格式。
轉錄後的文字。
對於 verbose_json:
回傳時表示任務名稱,例如 transcribe。
偵測到的語言。
音訊時長(秒)。
含時間戳記的轉錄片段。
詞級時間戳記(若有請求)。
已接受的非同步轉錄任務回傳以下欄位,而非轉錄文字:
任務 ID。
可用時返回的非同步任務 ID 別名。
任務狀態:pending、processing、completed 或 failed。
建立回應提供時,優先使用的輪詢 URL。
請求
curl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \
-H "Authorization: Bearer sk-your-api-key" \
-F file="@audio.mp3" \
-F model="whisper-1" \
-F language="en"回應
{
"text": "Hello, this is a test of the transcription API."
}翻譯
若要將音訊翻譯為英文,請使用 translations endpoint:
with open("audio.mp3", "rb") as audio_file:
response = client.audio.translations.create(
model="whisper-1",
file=audio_file
)
print(response.text)授權
BearerAuth API Key 驗證。請在 Dashboard > API > API Keys 建立或管理 API 金鑰。
位置: header
請求標頭
單次請求傳遞策略。會覆寫 API key 與 Workspace 的預設值。系統會自動優先嘗試 TokenLab Verified,並可能在輸出、請求接受或建立持久性資源前切換至 Official 模式一次。
可選值
- "auto"
- "verified"
- "official"
請求主體
multipart/form-data
回應
application/json
application/json
application/json
application/json
application/json
application/json