音频与实时
创建转录
将音频转录为输入语言
请求体
转录可能直接返回文本,也可能以 HTTP 200、id 和 status 返回已接受的异步任务。异步任务请按 poll_url 查询,或使用 /v1/tasks/{id}。同步处理较长音频时,请将客户端超时设为至少 120s。
要转录的音频文件。支持的格式:flac、mp3、mp4、mpeg、mpga、m4a、ogg、wav、webm。 最大文件大小:25 MB。
whisper-1转录模型 ID,例如 whisper-1 或 gpt-4o-transcribe。通过 GET /v1/models?recommended_for=stt 获取当前可选模型。
音频的语言,采用 ISO-639-1 格式(例如:en、zh、ja)。
可选提示词,可补充专有名词、上下文或期望的文字风格。
json输出格式。Whisper 支持 json、text、srt、verbose_json 和 vtt;其他模型支持的范围可能不同,请查询模型详情。
采样温度,范围为 0–1,仅适用于支持此参数的模型。
所选模型支持时,可指定 word 和/或 segment。Whisper 需要 response_format=verbose_json。multipart 请求中,多值应重复发送 timestamp_granularities[]。
响应
以下字段用于 JSON 转录或翻译响应。text、srt 和 vtt 返回原始文本或字幕,而不是 JSON 对象。附加字段取决于模型和输出格式。
转录后的文本。
对于 verbose_json:
返回时表示任务名称,例如 transcribe。
检测到的语言。
音频时长,单位为秒。
带时间戳的转录片段。
词级时间戳(如已请求)。
已接受的异步转录任务返回以下字段,而不是转录文本:
任务 ID。
返回时,作为异步任务标识的别名。
任务状态:pending、processing、completed 或 failed。
创建响应提供时,优先使用的轮询 URL。
请求
curl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \
-H "Authorization: Bearer sk-your-api-key" \
-F file="@audio.mp3" \
-F model="whisper-1" \
-F language="en"响应
{
"text": "Hello, this is a test of the transcription API."
}翻译成英文
需要英文结果时,使用音频翻译接口:
with open("audio.mp3", "rb") as audio_file:
response = client.audio.translations.create(
model="whisper-1",
file=audio_file
)
print(response.text)授权
BearerAuth API Key 身份验证。在 Dashboard > API > API Keys 中创建或管理 API Key。
位置: header
请求头
单次请求的交付策略。覆盖 API 密钥和 Workspace 的默认设置。自动优先尝试 TokenLab Verified,并在输出、请求接受或持久资源创建之前,可能会切换一次至仅限 Official。
可选值
- "auto"
- "verified"
- "official"
请求体
multipart/form-data
响应
application/json
application/json
application/json
application/json
application/json
application/json