音频与实时
创建语音
根据输入文本生成音频
请求体
返回方式取决于所选模型和 stream_format。输入较长时,请将 HTTP 客户端超时设为至少 120s。
可选字段、音色、输出格式和 SSE 支持均以所选模型为准。发送前请查询 GET /v1/models/{model};不支持的参数可能返回 400 unsupported_parameter。
tts-1TTS 模型 ID。通过 GET /v1/models?recommended_for=tts 获取当前可选模型。
用于生成音频的文本。最大 4096 个字符。
语音选择器。可以传入 nova 等内置语音、Kore 等 Gemini 语音,或为兼容的自定义语音传入 { "id": "voice-id" }。
适用于支持此参数的模型,例如兼容的 MiniMax 语音模型。
朗读风格或语气说明,适用于支持该字段的 OpenAI TTS 模型。
Gemini TTS 的朗读风格说明。
语言代码,例如 en-US。适用于 Gemini、xAI 和其他支持该字段的 TTS 模型。
音频格式。常见值包括 mp3、opus、aac、flac、wav 和 pcm,以模型详情为准。
audio返回方式:audio 或 sse。tts-1 和 tts-1-hd 不支持 sse。
语速,范围为 0.25–4.0。只在支持该字段的模型中生效。
Gemini TTS 的采样温度,范围为 0–2。
响应
stream_format=audio 返回音频字节;支持 stream_format=sse 的模型返回 text/event-stream,应解析其中的事件,不要将整个响应直接保存为音频文件。
请求
curl -X POST "https://api.tokenlab.sh/v1/audio/speech" \
-H "Authorization: Bearer sk-your-api-key" \
-H "Content-Type: application/json" \
-d '{
"model": "tts-1-hd",
"voice": "nova",
"input": "Hello, welcome to TokenLab!"
}' \
--output speech.mp3响应
<binary audio data>重要字段
HTTP 响应的媒体类型:音频格式,或 SSE 使用的 text/event-stream。
audio 模式为音频字节,sse 模式为事件流。请按 Content-Type 和请求模式选择解析方式。
MiniMax Speech 2.8 Turbo 可用指定声音快速合成文字脚本,适用于需要及时响应的语音界面和旁白。
{
"model": "speech-2.8-turbo",
"input": "Welcome to TokenLab.",
"voice_id": "male-qn-qingse",
"speed": 1,
"response_format": "mp3",
"stream_format": "audio"
}授权
BearerAuth API Key 身份验证。在 Dashboard > API > API Keys 中创建或管理 API Key。
位置: header
请求头
单次请求的交付策略。覆盖 API 密钥和 Workspace 的默认设置。自动优先尝试 TokenLab Verified,并在输出、请求接受或持久资源创建之前,可能会切换一次至仅限 Official。
可选值
- "auto"
- "verified"
- "official"
请求体
application/json
响应
application/json
application/json
application/json
application/json
application/json
application/json