Alibaba: Qwen3-TTS 1.7B CustomVoice
qwen3-tts-1-7b-customvoice- 价格
- 起 $0.000015
- 模态
- 音频
Qwen3-TTS 1.7B CustomVoice 简介
Qwen3-TTS 1.7B CustomVoice 是阿里巴巴的语音合成模型,围绕九个固定的预设音色构建。你按名字选择说话人,还可以用一句大白话描述语气、情绪或说话风格。它支持包括中文、英语、日语、韩语和几种欧洲语言在内的十种语言,阿里巴巴称端到端合成延迟最低可达 97 ms,适合交互场景。
擅长的任务
- 九个有名字的高品质音色涵盖不同性别、年龄、语言和方言,整个产品可以始终用同一个声音。
- 一句文字说明就能调整情绪和说话方式,而不改变所选的说话人。
- 支持十种语言:中文、英语、日语、韩语、德语、法语、俄语、葡萄牙语、西班牙语和意大利语。
- 阿里巴巴称端到端延迟最低可达 97 ms,适合语音助手和实时解说。
什么情况换别的模型
- 音色列表是固定的;想根据描述创造新音色,VoiceDesign 版本更合适。
- 说话人朗读自己的母语时效果最好,所以让英语预设音色读日语,可能会有口音。
- 带有大量标记或混杂符号等杂乱、不寻常的输入文本,会降低输出质量。
快速上手
创建 API 密钥
在 Console 生成一把密钥,平台上的模型都能用。
发送第一个请求
复制你所用语言的示例代码,向该端点发起请求。
文本转语音TokenLab 端点POST/v1/audio/speechcurl -X POST "https://api.tokenlab.sh/v1/audio/speech" \ -H "Authorization: Bearer sk-xxx" \ -H "Content-Type: application/json" \ -d '{ "operation": "tts", "model": "qwen3-tts-1-7b-customvoice", "input": "Hello from TokenLab.", "voice": "alloy" }'
价格
官方价格是模型厂商公开的基线价,TokenLab 价格是用这个模型时实际的计费价。
文本转语音
每百万字符- 官方价格
- $0.000015
- Official
- $0.000015
- 折扣
- —
| 官方价格每百万字符 | Official每百万字符 | 折扣 | |
|---|---|---|---|
| 文本转语音 | $0.000015 | $0.000015 | — |
用量与动态
成功率是请求完成的比例;延迟是拿到一次完整响应要花的时间,P95 表示 95% 的请求都在这个时间内完成。
用量与可用性
最近 24 小时- 请求
- 成功率
- P95 延迟
- 总 token 数
数据来自汇总的用户请求,不含状态检查。
直接在 Console 里试
Qwen3-TTS 1.7B CustomVoice 已在 Console 备好,提示词已填好,可以直接修改或发送。
帮我用 qwen3-tts-1-7b-customvoice 发起一条简短的音频请求,接口是 /v1/audio/speech。返回结果和费用。
使用场景
语音助手
给应用内助手一个稳定的、有名字的声音和很低的响应延迟,文字一就绪,回复就能很快开始播放。
有声书和文章朗读
用选定的说话人朗读长文,并加上“平静温暖”之类的说明,让各章节的朗读风格保持一致。
本地化的产品视频
用日语、韩语或英语预设音色,为各个市场配同一份脚本,同时让品牌保持可辨识的声音。
游戏和角色台词
为不同角色挑选不同的预设音色,并用情绪说明来处理愤怒、疲惫或兴奋的台词。
提示词示例
说话人:Ryan。说明:平静、友好、语速稍慢。文本:Welcome back. Your order has shipped and should arrive on Thursday.
说话人:Ono_Anna。说明:开朗的播音员。文本:本日はご来店いただき、ありがとうございます。
说话人:Vivian。说明:耳语,像在说一个秘密。文本:你听说了吗?明天会有一个大消息。
FAQ
Qwen3-TTS CustomVoice 有哪些音色?
九个预设:中文方向有 Vivian、Serena、Uncle_Fu、Dylan 和 Eric,英语有 Ryan 和 Aiden,日语有 Ono_Anna,韩语有 Sohee。每次请求按名字选一个。
可以控制情绪和说话风格吗?
可以。你可以加一句自然语言说明,比如愤怒、温柔,或者语速快而兴奋,模型会调整语气和方式,同时保持所选说话人的音色。
CustomVoice 和 VoiceDesign 有什么区别?
CustomVoice 使用九个固定的说话人,由你选择。VoiceDesign 没有预设列表,你用文字描述想要的声音,比如年龄、情绪和韵律,模型来创造它。要一致性选 CustomVoice,要新音色选 VoiceDesign。
它能说哪些语言?
十种:中文、英语、日语、韩语、德语、法语、俄语、葡萄牙语、西班牙语和意大利语。模型卡建议让每个说话人使用自己的母语,以获得最佳质量。
速度够用于实时对话吗?
阿里巴巴称端到端合成延迟最低可达 97 ms,面向实时使用。你的应用里实际的延迟还取决于网络距离和文本长度,请用自己的流量测一下。
Qwen3-TTS 1.7B CustomVoice 的费用是多少?
在 TokenLab 上,Qwen3-TTS 1.7B CustomVoice 的价格为 - 。完整明细见上方价格表。 价格因计费单位、规格和用量而异。请在模型的详细定价中对比相同条件下的费率;单一费率不代表总价。
Qwen3-TTS 1.7B CustomVoice 应该使用哪个端点?
Qwen3-TTS 1.7B CustomVoice 使用 https://api.tokenlab.sh/v1/audio/speech。代码写法见下方的请求示例。
Qwen3-TTS 1.7B CustomVoice 支持哪些操作?
Qwen3-TTS 1.7B CustomVoice 支持 文本转语音。选了操作,上面会显示对应的端点和请求示例。
Qwen3-TTS 1.7B CustomVoice 对比
资料来源
审阅于 2026年10月2日