每次请求可选择 Auto、TokenLab Verified 或 Official,并查看对应价格。查看更新

Alibaba: Sambert Zhiyuan v1

Sambert Zhiyuan v1 提供固定的中文合成音色,适合讲解、通知和朗读等需要保持统一普通话声音形象的内容。
对比模型
sambert-zhiyuan-v1
可用Alibaba文本转语音同步
输入 / 输出
$14.71 / $0.00
模态
音频

Sambert Zhiyuan v1 简介

Sambert Zhiyuan v1 是阿里巴巴 Sambert 语音合成系列里的一个具名音色,面向通用的中文旁白。知远(Zhiyuan)是沉稳、书卷气的女声,也能读英文,支持词级时间戳,默认采样率 16 kHz。它是较早的固定音色引擎:没有克隆、方言列表,也没有 CosyVoice v3.5 Plus 或 Qwen3-TTS-Flash 那样的风格控制。

擅长的任务

  • 输出一致的单一音色,重复的内容听起来是同一位旁白。
  • 支持时间戳,便于同步字幕,或在朗读时高亮文字。
  • 能朗读中文和英文文本。
  • 适合文章、公告这类沉稳的说明性内容。

什么情况换别的模型

  • 它是固定的单一音色,没有克隆或音色设计,所以无法代表自定义的品牌声音。
  • 它是 Sambert 时代的较早模型,没有针对情绪或风格的指令控制。
  • 默认 16 kHz 输出的保真度,低于较新的语音合成模型。

快速上手

  1. 创建 API 密钥

    在 Console 生成一把密钥,平台上的模型都能用。

  2. 发送第一个请求

    复制你所用语言的示例代码,向该端点发起请求。

    文本转语音TokenLab 端点
    POST/v1/audio/speech
    curl -X POST "https://api.tokenlab.sh/v1/audio/speech" \
      -H "Authorization: Bearer sk-xxx" \
      -H "Content-Type: application/json" \
      -d '{
      "operation": "tts",
      "response_format": "mp3",
      "speed": 1,
      "model": "sambert-zhiyuan-v1",
      "input": "Hello from TokenLab.",
      "voice": "alloy"
    }'

价格

官方价格是模型厂商公开的基线价,TokenLab 价格是用这个模型时实际的计费价。

Tts Text Number

每百万字符
官方价格
输入 $14.71 / 输出 $0.00
Official
输入 $14.71 / 输出 $0.00
折扣
—

用量与动态

成功率是请求完成的比例;延迟是拿到一次完整响应要花的时间,P95 表示 95% 的请求都在这个时间内完成。

用量与可用性

最近 24 小时
请求
成功率
P95 延迟
总 token 数
模型表现
达到隐私和数据量阈值后,指标才会显示。

数据来自汇总的用户请求,不含状态检查。

直接在 Console 里试

Sambert Zhiyuan v1 已在 Console 备好,提示词已填好,可以直接修改或发送。

帮我用 sambert-zhiyuan-v1 发起一条简短的音频请求,接口是 /v1/audio/speech。返回结果和费用。

使用场景

  • 文章朗读

    用始终如一的声音朗读长篇中文文章,从头到尾音色不变。

  • 带字幕的讲解视频

    在简短的教学视频里,用时间戳让屏幕上的文字与旁白同步。

  • 公告播报

    为自助终端、应用和广播式消息生成语气一致的重复通知。

提示词示例

请用普通话,以平稳、均匀的语速朗读这则通知。

朗读下面这段文字,并给我提供词级时间戳用于做字幕。

朗读这段中英双语的产品介绍,先中文,后英文。

FAQ

Sambert Zhiyuan v1 是什么?

它是阿里巴巴 Sambert 语音合成系列里一个名为知远(Zhiyuan)的固定女声。阿里将它描述为通用的中文音色,语气沉稳、有书卷气,也能处理英文文本。

支持时间戳吗?

支持。阿里为这个音色列出了时间戳输出,可以在音频播放时对齐字幕或高亮单词,适合阅读类和讲解类应用。

可以自定义音色吗?

不可以。知远是固定音色。需要克隆、音色设计或风格指令,请用 CosyVoice v3.5 Plus;想通过 HTTP 调用现成的多语言音色,请用 Qwen3-TTS-Flash。

输出的采样率是多少?

按阿里的文档,默认是 16 kHz。用于应用和提示音的语音足够,但在类似音乐或广播的场景,较新的合成模型可能提供更丰富的音质。

Sambert 什么时候仍然是好选择?

需要稳定、可预期的中文旁白和时间戳,而不需要方言、克隆或情绪控制的时候。多数新项目里,Qwen3-TTS-Flash 的语言覆盖更广。

Sambert Zhiyuan v1 的费用是多少?

在 TokenLab 上,Sambert Zhiyuan v1 的价格为 输入 $14.71 / 输出 $0.00 每百万字符。完整明细见上方价格表。 价格因计费单位、规格和用量而异。请在模型的详细定价中对比相同条件下的费率;单一费率不代表总价。

Sambert Zhiyuan v1 应该使用哪个端点?

Sambert Zhiyuan v1 使用 https://api.tokenlab.sh/v1/audio/speech。代码写法见下方的请求示例。

Sambert Zhiyuan v1 支持哪些操作?

Sambert Zhiyuan v1 支持 文本转语音。选了操作,上面会显示对应的端点和请求示例。

Sambert Zhiyuan v1 对比

资料来源

审阅于 2026年10月2日

相关模型