每次请求可选择 Auto、TokenLab Verified 或 Official,并查看对应价格。查看更新

Alibaba: Qwen3-TTS 1.7B CustomVoice

Alibaba 的 Qwen3-TTS 1.7B CustomVoice 用于语音生成,已通过 Runware 的原生接口完成验证。
对比模型
qwen3-tts-1-7b-customvoice
可用Alibaba文本转语音同步
价格
起 $0.000015
模态
音频

Qwen3-TTS 1.7B CustomVoice 简介

Qwen3-TTS 1.7B CustomVoice 是阿里巴巴的语音合成模型,围绕九个固定的预设音色构建。你按名字选择说话人,还可以用一句大白话描述语气、情绪或说话风格。它支持包括中文、英语、日语、韩语和几种欧洲语言在内的十种语言,阿里巴巴称端到端合成延迟最低可达 97 ms,适合交互场景。

擅长的任务

  • 九个有名字的高品质音色涵盖不同性别、年龄、语言和方言,整个产品可以始终用同一个声音。
  • 一句文字说明就能调整情绪和说话方式,而不改变所选的说话人。
  • 支持十种语言:中文、英语、日语、韩语、德语、法语、俄语、葡萄牙语、西班牙语和意大利语。
  • 阿里巴巴称端到端延迟最低可达 97 ms,适合语音助手和实时解说。

什么情况换别的模型

  • 音色列表是固定的;想根据描述创造新音色,VoiceDesign 版本更合适。
  • 说话人朗读自己的母语时效果最好,所以让英语预设音色读日语,可能会有口音。
  • 带有大量标记或混杂符号等杂乱、不寻常的输入文本,会降低输出质量。

快速上手

  1. 创建 API 密钥

    在 Console 生成一把密钥,平台上的模型都能用。

  2. 发送第一个请求

    复制你所用语言的示例代码,向该端点发起请求。

    文本转语音TokenLab 端点
    POST/v1/audio/speech
    curl -X POST "https://api.tokenlab.sh/v1/audio/speech" \
      -H "Authorization: Bearer sk-xxx" \
      -H "Content-Type: application/json" \
      -d '{
      "operation": "tts",
      "model": "qwen3-tts-1-7b-customvoice",
      "input": "Hello from TokenLab.",
      "voice": "alloy"
    }'

价格

官方价格是模型厂商公开的基线价,TokenLab 价格是用这个模型时实际的计费价。

文本转语音

每百万字符
官方价格
$0.000015
Official
$0.000015
折扣
—

用量与动态

成功率是请求完成的比例;延迟是拿到一次完整响应要花的时间,P95 表示 95% 的请求都在这个时间内完成。

用量与可用性

最近 24 小时
请求
成功率
P95 延迟
总 token 数
模型表现
达到隐私和数据量阈值后,指标才会显示。

数据来自汇总的用户请求,不含状态检查。

直接在 Console 里试

Qwen3-TTS 1.7B CustomVoice 已在 Console 备好,提示词已填好,可以直接修改或发送。

帮我用 qwen3-tts-1-7b-customvoice 发起一条简短的音频请求,接口是 /v1/audio/speech。返回结果和费用。

使用场景

  • 语音助手

    给应用内助手一个稳定的、有名字的声音和很低的响应延迟,文字一就绪,回复就能很快开始播放。

  • 有声书和文章朗读

    用选定的说话人朗读长文,并加上“平静温暖”之类的说明,让各章节的朗读风格保持一致。

  • 本地化的产品视频

    用日语、韩语或英语预设音色,为各个市场配同一份脚本,同时让品牌保持可辨识的声音。

  • 游戏和角色台词

    为不同角色挑选不同的预设音色,并用情绪说明来处理愤怒、疲惫或兴奋的台词。

提示词示例

说话人:Ryan。说明:平静、友好、语速稍慢。文本:Welcome back. Your order has shipped and should arrive on Thursday.

说话人:Ono_Anna。说明:开朗的播音员。文本:本日はご来店いただき、ありがとうございます。

说话人:Vivian。说明:耳语,像在说一个秘密。文本:你听说了吗?明天会有一个大消息。

FAQ

Qwen3-TTS CustomVoice 有哪些音色?

九个预设:中文方向有 Vivian、Serena、Uncle_Fu、Dylan 和 Eric,英语有 Ryan 和 Aiden,日语有 Ono_Anna,韩语有 Sohee。每次请求按名字选一个。

可以控制情绪和说话风格吗?

可以。你可以加一句自然语言说明,比如愤怒、温柔,或者语速快而兴奋,模型会调整语气和方式,同时保持所选说话人的音色。

CustomVoice 和 VoiceDesign 有什么区别?

CustomVoice 使用九个固定的说话人,由你选择。VoiceDesign 没有预设列表,你用文字描述想要的声音,比如年龄、情绪和韵律,模型来创造它。要一致性选 CustomVoice,要新音色选 VoiceDesign。

它能说哪些语言?

十种:中文、英语、日语、韩语、德语、法语、俄语、葡萄牙语、西班牙语和意大利语。模型卡建议让每个说话人使用自己的母语,以获得最佳质量。

速度够用于实时对话吗?

阿里巴巴称端到端合成延迟最低可达 97 ms,面向实时使用。你的应用里实际的延迟还取决于网络距离和文本长度,请用自己的流量测一下。

Qwen3-TTS 1.7B CustomVoice 的费用是多少?

在 TokenLab 上,Qwen3-TTS 1.7B CustomVoice 的价格为 - 。完整明细见上方价格表。 价格因计费单位、规格和用量而异。请在模型的详细定价中对比相同条件下的费率;单一费率不代表总价。

Qwen3-TTS 1.7B CustomVoice 应该使用哪个端点?

Qwen3-TTS 1.7B CustomVoice 使用 https://api.tokenlab.sh/v1/audio/speech。代码写法见下方的请求示例。

Qwen3-TTS 1.7B CustomVoice 支持哪些操作?

Qwen3-TTS 1.7B CustomVoice 支持 文本转语音。选了操作,上面会显示对应的端点和请求示例。

Qwen3-TTS 1.7B CustomVoice 对比

资料来源

审阅于 2026年10月2日

更多 Qwen TTS 模型

相关模型