每次请求可选择 Auto、TokenLab Verified 或 Official,并查看对应价格。查看更新

Alibaba: Qwen3-TTS 1.7B VoiceDesign

Alibaba 的 Qwen3-TTS 1.7B VoiceDesign 用于语音生成,已通过 Runware 的原生接口完成验证。
对比模型
qwen3-tts-1-7b-voicedesign
可用Alibaba文本转语音同步
价格
起 $0.000015
模态
音频

Qwen3-TTS 1.7B VoiceDesign 简介

Qwen3-TTS 1.7B VoiceDesign 是阿里巴巴语音合成的一个版本,根据文字描述创造声音,而不是从预设列表里选。你用自然语言描述情绪、语气和韵律,模型就用那样的声音读出文本。它支持十种语言,适合现有说话人都不符合你心目中的角色或品牌形象的情况。

擅长的任务

  • 声音由描述来定义,比如“语速缓慢、语气温暖的老年旁白”,而不是从固定列表里选。
  • 音色、情绪和韵律都可以通过说明来调整,包括愤怒这类强烈的情绪。
  • 覆盖十种语言:中文、英语、日语、韩语、德语、法语、俄语、葡萄牙语、西班牙语和意大利语,另有方言变体。
  • 阿里巴巴列出 Qwen3-TTS 系列的合成延迟低至约 97 ms,适合交互场景。

什么情况换别的模型

  • 同一段描述在不同次调用中可能生成略有差异的声音,所以需要同一个确切声音连续用上几个月时,它不是很合适。
  • 想要固定的、有名字的说话人,带九个预设音色的 CustomVoice 版本更可预测。
  • 质量取决于你描述声音的清晰程度;含糊的描述只会得到泛泛的结果。

快速上手

  1. 创建 API 密钥

    在 Console 生成一把密钥,平台上的模型都能用。

  2. 发送第一个请求

    复制你所用语言的示例代码,向该端点发起请求。

    文本转语音TokenLab 端点
    POST/v1/audio/speech
    curl -X POST "https://api.tokenlab.sh/v1/audio/speech" \
      -H "Authorization: Bearer sk-xxx" \
      -H "Content-Type: application/json" \
      -d '{
      "operation": "tts",
      "model": "qwen3-tts-1-7b-voicedesign",
      "input": "Hello from TokenLab.",
      "voice": "alloy"
    }'

价格

官方价格是模型厂商公开的基线价,TokenLab 价格是用这个模型时实际的计费价。

文本转语音

每百万字符
官方价格
$0.000015
Official
$0.000015
折扣
—

用量与动态

成功率是请求完成的比例;延迟是拿到一次完整响应要花的时间,P95 表示 95% 的请求都在这个时间内完成。

用量与可用性

最近 24 小时
请求
成功率
P95 延迟
总 token 数
模型表现
达到隐私和数据量阈值后,指标才会显示。

数据来自汇总的用户请求,不含状态检查。

直接在 Console 里试

Qwen3-TTS 1.7B VoiceDesign 已在 Console 备好,提示词已填好,可以直接修改或发送。

帮我用 qwen3-tts-1-7b-voicedesign 发起一条简短的音频请求,接口是 /v1/audio/speech。返回结果和费用。

使用场景

  • 游戏角色配音

    描述每个角色,比如粗声粗气的矮人铁匠或紧张的年轻信使,不用先找配音演员就能生成台词。

  • 探索品牌声音

    尝试对企业声音的几种描述,比如自信低沉对明亮轻快,并在同一份脚本上对比。

  • 有表现力的旁白

    在同一个项目里,用“压低声音、紧张”再到“如释重负、温暖”这样的说明来指导故事各段的朗读方式。

  • 视频的原型配音

    在最终配音敲定之前,为分镜或讲解视频创建一个临时旁白。

提示词示例

声音:中年女性,平静低沉,语速缓慢,像纪录片旁白。文本:The river has changed course three times in the last century.

声音:年轻男性,兴奋,略微气喘,语速很快。文本:You will not believe what just came through the door.

声音:用特别愤怒的语气说,语速快,断句短促。文本:这已经是第三次了,你们到底有没有在听?

FAQ

Qwen3-TTS VoiceDesign 是做什么用的?

它用你用文字指定的声音来生成语音。你不用选有名字的说话人,而是写一段涵盖情绪、语气和朗读方式的描述,模型生成与之相符的音频。适合与现成预设不匹配的角色和品牌声音。

它和 CustomVoice 有什么区别?

CustomVoice 提供九个固定的、有名字的说话人,可附带风格说明。VoiceDesign 没有固定列表,根据你的描述构建声音。想创造新声音选 VoiceDesign,要稳定、可重复的说话人选 CustomVoice。

支持哪些语言?

十种:中文、英语、日语、韩语、德语、法语、俄语、葡萄牙语、西班牙语和意大利语,另有部分方言变体。声音描述请用模型能理解的语言来写;模型卡上的示例用的是中文。

能用它克隆真人的声音吗?

Qwen3-TTS 系列提到可以根据一小段样本克隆声音,但这个版本本身的重点是基于说明来设计声音。只克隆或模仿你有权使用的声音,并对照自己的授权规则检查输出。

每次调用的声音都完全一样吗?

不保证。描述能引导声音,但不能锁定某个确切的音色,所以多次调用听起来可能略有不同。如果在一个长项目里需要完全一致,请改用固定的预设说话人。

Qwen3-TTS 1.7B VoiceDesign 的费用是多少?

在 TokenLab 上,Qwen3-TTS 1.7B VoiceDesign 的价格为 - 。完整明细见上方价格表。 价格因计费单位、规格和用量而异。请在模型的详细定价中对比相同条件下的费率;单一费率不代表总价。

Qwen3-TTS 1.7B VoiceDesign 应该使用哪个端点?

Qwen3-TTS 1.7B VoiceDesign 使用 https://api.tokenlab.sh/v1/audio/speech。代码写法见下方的请求示例。

Qwen3-TTS 1.7B VoiceDesign 支持哪些操作?

Qwen3-TTS 1.7B VoiceDesign 支持 文本转语音。选了操作,上面会显示对应的端点和请求示例。

Qwen3-TTS 1.7B VoiceDesign 对比

资料来源

审阅于 2026年10月2日

更多 Qwen TTS 模型

相关模型