Alibaba: Qwen3-TTS 1.7B VoiceDesign
qwen3-tts-1-7b-voicedesign- 价格
- 起 $0.000015
- 模态
- 音频
Qwen3-TTS 1.7B VoiceDesign 简介
Qwen3-TTS 1.7B VoiceDesign 是阿里巴巴语音合成的一个版本,根据文字描述创造声音,而不是从预设列表里选。你用自然语言描述情绪、语气和韵律,模型就用那样的声音读出文本。它支持十种语言,适合现有说话人都不符合你心目中的角色或品牌形象的情况。
擅长的任务
- 声音由描述来定义,比如“语速缓慢、语气温暖的老年旁白”,而不是从固定列表里选。
- 音色、情绪和韵律都可以通过说明来调整,包括愤怒这类强烈的情绪。
- 覆盖十种语言:中文、英语、日语、韩语、德语、法语、俄语、葡萄牙语、西班牙语和意大利语,另有方言变体。
- 阿里巴巴列出 Qwen3-TTS 系列的合成延迟低至约 97 ms,适合交互场景。
什么情况换别的模型
- 同一段描述在不同次调用中可能生成略有差异的声音,所以需要同一个确切声音连续用上几个月时,它不是很合适。
- 想要固定的、有名字的说话人,带九个预设音色的 CustomVoice 版本更可预测。
- 质量取决于你描述声音的清晰程度;含糊的描述只会得到泛泛的结果。
快速上手
创建 API 密钥
在 Console 生成一把密钥,平台上的模型都能用。
发送第一个请求
复制你所用语言的示例代码,向该端点发起请求。
文本转语音TokenLab 端点POST/v1/audio/speechcurl -X POST "https://api.tokenlab.sh/v1/audio/speech" \ -H "Authorization: Bearer sk-xxx" \ -H "Content-Type: application/json" \ -d '{ "operation": "tts", "model": "qwen3-tts-1-7b-voicedesign", "input": "Hello from TokenLab.", "voice": "alloy" }'
价格
官方价格是模型厂商公开的基线价,TokenLab 价格是用这个模型时实际的计费价。
文本转语音
每百万字符- 官方价格
- $0.000015
- Official
- $0.000015
- 折扣
- —
| 官方价格每百万字符 | Official每百万字符 | 折扣 | |
|---|---|---|---|
| 文本转语音 | $0.000015 | $0.000015 | — |
用量与动态
成功率是请求完成的比例;延迟是拿到一次完整响应要花的时间,P95 表示 95% 的请求都在这个时间内完成。
用量与可用性
最近 24 小时- 请求
- 成功率
- P95 延迟
- 总 token 数
数据来自汇总的用户请求,不含状态检查。
直接在 Console 里试
Qwen3-TTS 1.7B VoiceDesign 已在 Console 备好,提示词已填好,可以直接修改或发送。
帮我用 qwen3-tts-1-7b-voicedesign 发起一条简短的音频请求,接口是 /v1/audio/speech。返回结果和费用。
使用场景
游戏角色配音
描述每个角色,比如粗声粗气的矮人铁匠或紧张的年轻信使,不用先找配音演员就能生成台词。
探索品牌声音
尝试对企业声音的几种描述,比如自信低沉对明亮轻快,并在同一份脚本上对比。
有表现力的旁白
在同一个项目里,用“压低声音、紧张”再到“如释重负、温暖”这样的说明来指导故事各段的朗读方式。
视频的原型配音
在最终配音敲定之前,为分镜或讲解视频创建一个临时旁白。
提示词示例
声音:中年女性,平静低沉,语速缓慢,像纪录片旁白。文本:The river has changed course three times in the last century.
声音:年轻男性,兴奋,略微气喘,语速很快。文本:You will not believe what just came through the door.
声音:用特别愤怒的语气说,语速快,断句短促。文本:这已经是第三次了,你们到底有没有在听?
FAQ
Qwen3-TTS VoiceDesign 是做什么用的?
它用你用文字指定的声音来生成语音。你不用选有名字的说话人,而是写一段涵盖情绪、语气和朗读方式的描述,模型生成与之相符的音频。适合与现成预设不匹配的角色和品牌声音。
它和 CustomVoice 有什么区别?
CustomVoice 提供九个固定的、有名字的说话人,可附带风格说明。VoiceDesign 没有固定列表,根据你的描述构建声音。想创造新声音选 VoiceDesign,要稳定、可重复的说话人选 CustomVoice。
支持哪些语言?
十种:中文、英语、日语、韩语、德语、法语、俄语、葡萄牙语、西班牙语和意大利语,另有部分方言变体。声音描述请用模型能理解的语言来写;模型卡上的示例用的是中文。
能用它克隆真人的声音吗?
Qwen3-TTS 系列提到可以根据一小段样本克隆声音,但这个版本本身的重点是基于说明来设计声音。只克隆或模仿你有权使用的声音,并对照自己的授权规则检查输出。
每次调用的声音都完全一样吗?
不保证。描述能引导声音,但不能锁定某个确切的音色,所以多次调用听起来可能略有不同。如果在一个长项目里需要完全一致,请改用固定的预设说话人。
Qwen3-TTS 1.7B VoiceDesign 的费用是多少?
在 TokenLab 上,Qwen3-TTS 1.7B VoiceDesign 的价格为 - 。完整明细见上方价格表。 价格因计费单位、规格和用量而异。请在模型的详细定价中对比相同条件下的费率;单一费率不代表总价。
Qwen3-TTS 1.7B VoiceDesign 应该使用哪个端点?
Qwen3-TTS 1.7B VoiceDesign 使用 https://api.tokenlab.sh/v1/audio/speech。代码写法见下方的请求示例。
Qwen3-TTS 1.7B VoiceDesign 支持哪些操作?
Qwen3-TTS 1.7B VoiceDesign 支持 文本转语音。选了操作,上面会显示对应的端点和请求示例。
Qwen3-TTS 1.7B VoiceDesign 对比
资料来源
审阅于 2026年10月2日