每次请求可选择 Auto、TokenLab Verified 或 Official,并查看对应价格。查看更新

Alibaba: CosyVoice v3.5 Plus

CosyVoice v3.5 Plus 将文字稿转为富有表现力的语音,适合文章朗读、对话式配音和产品语音引导,可按听众和内容选择音色与语速。
对比模型
cosyvoice-v3.5-plus
可用Alibaba文本转语音同步
输入 / 输出
$22.06 / $0.00
模态
音频

CosyVoice v3.5 Plus 简介

CosyVoice v3.5 Plus 是阿里巴巴的语音合成模型,用于你自己创建的声音。它没有内置音色列表:你要先用一段样本克隆声音,或者用文字描述设计一个声音,再通过 WebSocket 连接用它合成语音。它支持普通话、英语和其他几种语言,以及许多中国方言,并且可以用自然语言指令控制朗读方式,Qwen3-TTS-Flash 做不到这一点。

擅长的任务

  • 支持用录音克隆的声音,或用文字描述设计的声音。
  • 接受指令来控制语气和说话风格。
  • 支持普通话、粤语和许多中国方言,也支持英语、法语、德语、日语、韩语、俄语、葡萄牙语、泰语、印度尼西亚语和越南语。
  • 通过 WebSocket 流式输出音频,合成完成前就可以开始播放。

什么情况换别的模型

  • 没有内置的系统音色,必须先创建克隆或设计的声音。
  • 需要 WebSocket 客户端,不能只用简单的 HTTP 请求。
  • 克隆声音需要干净的参考样本,并且要获得该声音使用的授权。

快速上手

  1. 创建 API 密钥

    在 Console 生成一把密钥,平台上的模型都能用。

  2. 发送第一个请求

    复制你所用语言的示例代码,向该端点发起请求。

    文本转语音TokenLab 端点
    POST/v1/audio/speech
    curl -X POST "https://api.tokenlab.sh/v1/audio/speech" \
      -H "Authorization: Bearer sk-xxx" \
      -H "Content-Type: application/json" \
      -d '{
      "operation": "tts",
      "response_format": "mp3",
      "speed": 1,
      "model": "cosyvoice-v3.5-plus",
      "input": "Hello from TokenLab.",
      "voice": "alloy"
    }'

价格

官方价格是模型厂商公开的基线价,TokenLab 价格是用这个模型时实际的计费价。

Cosy Tts Number

每百万字符
官方价格
输入 $22.06 / 输出 $0.00
Official
输入 $22.06 / 输出 $0.00
折扣
—

用量与动态

成功率是请求完成的比例;延迟是拿到一次完整响应要花的时间,P95 表示 95% 的请求都在这个时间内完成。

用量与可用性

最近 24 小时
请求
成功率
P95 延迟
总 token 数
模型表现
达到隐私和数据量阈值后,指标才会显示。

数据来自汇总的用户请求,不含状态检查。

直接在 Console 里试

CosyVoice v3.5 Plus 已在 Console 备好,提示词已填好,可以直接修改或发送。

帮我用 cosyvoice-v3.5-plus 发起一条简短的音频请求,接口是 /v1/audio/speech。返回结果和费用。

使用场景

  • 品牌声音

    克隆一位已授权的说话人,之后用这个声音做产品导览、IVR 语音提示和公告。

  • 角色声音

    根据描述设计声音,比如温暖的年长讲故事人,用于有声书或游戏。

  • 方言旁白

    为本地听众制作四川话、上海话或粤语的语音内容。

提示词示例

用轻快、积极的语气读这则公告,日期后面稍作停顿。

把下面这段话读得慢一点、温柔一点,就像在讲睡前故事。

用粤语说这句话,语速放松,像日常聊天。

FAQ

CosyVoice v3.5 Plus 有预设音色吗?

没有。阿里巴巴没有为这个模型列出系统音色。你需要用样本克隆声音,或用文字描述设计声音,合成时再传入该声音。

CosyVoice v3.5 Plus 支持哪些语言和方言?

普通话、粤语和许多中国方言,以及英语、法语、德语、日语、韩语、俄语、葡萄牙语、泰语、印度尼西亚语和越南语。方言支持是它与 Qwen3-TTS-Flash 系列的主要区别。

可以控制它的发声效果吗?

可以。模型支持指令控制,可以用自然语言描述语气、情绪或节奏。所选声音决定谁在说,指令决定这句话怎么说。

怎么调用它?

通过 WebSocket API,音频边生成边流式返回。适合长脚本和实时播放,但需要能处理连接的客户端。

什么时候应该改用 Qwen3-TTS-Flash?

想用现成音色、简单的 HTTP 调用,又不需要克隆或指令控制时。声音身份或朗读风格是产品一部分时,选 CosyVoice。

CosyVoice v3.5 Plus 的费用是多少?

在 TokenLab 上,CosyVoice v3.5 Plus 的价格为 输入 $22.06 / 输出 $0.00 每百万字符。完整明细见上方价格表。 价格因计费单位、规格和用量而异。请在模型的详细定价中对比相同条件下的费率;单一费率不代表总价。

CosyVoice v3.5 Plus 应该使用哪个端点?

CosyVoice v3.5 Plus 使用 https://api.tokenlab.sh/v1/audio/speech。代码写法见下方的请求示例。

CosyVoice v3.5 Plus 支持哪些操作?

CosyVoice v3.5 Plus 支持 文本转语音。选了操作,上面会显示对应的端点和请求示例。

CosyVoice v3.5 Plus 对比

资料来源

审阅于 2026年10月2日

相关模型