每次请求可选择 Auto、TokenLab Verified 或 Official,并查看对应价格。查看更新

xAI: Grok Voice TTS

Grok Voice TTS 按所选音色与语言将文字合成为语音,适合本地化旁白、语音通知,以及把预先准备的文字转成音频回复的应用。
对比模型
grok-voice-tts
可用xAI文本转语音同步
输入 / 输出
$15.00 / $0.00
模态
音频

Grok Voice TTS 简介

Grok Voice TTS 是 xAI 的语音合成模型,用选定的声音和语言把书面文字渲染成语音。停顿、笑声、耳语等行内标签可以调整表达方式。文本已经写好、不需要实时对话的旁白、语音通知和本地化音频回答,可以用它。

擅长的任务

  • [pause]、[laugh] 等行内语音标签,以及 whisper 这类包裹式标签,让你在文本内部控制表达。
  • 内置声音都能说支持的语言,所以同一内容的各本地化版本可以沿用同一个声音形象。
  • 可以用一小段参考音频克隆自定义声音,用作品牌或角色的声音。
  • 可以返回字符级时间戳,用来让字幕或口型与音频同步。

什么情况换别的模型

  • 它朗读固定的文本;来电者要打断或回话的场景,需要用对话式语音模型。
  • 长脚本的输出质量取决于源文本中的标点和标签,未经编辑的机器文本听起来可能平淡。

快速上手

  1. 创建 API 密钥

    在 Console 生成一把密钥,平台上的模型都能用。

  2. 发送第一个请求

    复制你所用语言的示例代码,向该端点发起请求。

    文本转语音TokenLab 端点
    POST/v1/audio/speech
    curl -X POST "https://api.tokenlab.sh/v1/audio/speech" \
      -H "Authorization: Bearer sk-xxx" \
      -H "Content-Type: application/json" \
      -d '{
      "language_code": "en",
      "operation": "tts",
      "response_format": "mp3",
      "voice": "eve",
      "model": "grok-voice-tts",
      "input": "Hello from TokenLab."
    }'

价格

官方价格是模型厂商公开的基线价,TokenLab 价格是用这个模型时实际的计费价。

价格

每百万字符
Official
输入$15.00/百万字符输出$0.00/百万字符
官方价格
输入$15.00/百万字符输出$0.00/百万字符

用量与动态

成功率是请求完成的比例;延迟是拿到一次完整响应要花的时间,P95 表示 95% 的请求都在这个时间内完成。

用量与可用性

最近 24 小时
请求
成功率
P95 延迟
总 token 数
模型表现
达到隐私和数据量阈值后,指标才会显示。

数据来自汇总的用户请求,不含状态检查。

直接在 Console 里试

Grok Voice TTS 已在 Console 备好,提示词已填好,可以直接修改或发送。

帮我用 grok-voice-tts 发起一条简短的音频请求,接口是 /v1/audio/speech。返回结果和费用。

使用场景

  • 文章与课程旁白

    把写好的文章或课程脚本转成音轨,用停顿分隔各个章节。

  • 语音提醒

    通过电话编解码器,用用户的语言朗读订单更新或安全通知。

  • 本地化产品视频

    用选定的同一种声音配音多种语言的同一份脚本,再用时间戳对齐字幕。

提示词示例

用温暖、平稳的声音朗读这一段,每句话后加一个短的 [pause]。

先用法语播报下面的通知,再用德语重复一遍,使用同一个声音。

<whisper>您的包裹已发出。</whisper> [pause] 预计周四送达。

FAQ

Grok Voice TTS 是做什么的?

它把文字转成语音音频。你选择声音,可选语言代码,再选输出格式,它就返回该文本的音频,包括你在行内写的各种表达标签。

它能输出哪些音频格式?

MP3、WAV 和原始 PCM,以及电话编解码器 mu-law 和 A-law,采样率 8 kHz 到 48 kHz。电话编解码器适合电话系统;MP3 适合网页和移动端播放。

它能说多少种语言?

xAI 文档标明有二十种语言,通过 BCP-47 代码选择,也可以改用自动语言检测。每种内置声音都能说所有支持的语言,所以切换语言不需要换声音。

文字还在陆续到达时,能同时流式输出音频吗?

能。WebSocket 端点会在文字发送过来的同时实时生成音频,当另一个模型还在写要朗读的回复时,这很有用。

可以纠正读错的词吗?

可以。发音替换让你把书面术语映射为它应有的读音,所以品牌名和缩写能读对,而不必修改显示的文本。

Grok Voice TTS 的费用是多少?

在 TokenLab 上,Grok Voice TTS 的价格为 输入 $15.00 / 输出 $0.00 每百万字符。完整明细见上方价格表。

Grok Voice TTS 应该使用哪个端点?

Grok Voice TTS 使用 https://api.tokenlab.sh/v1/audio/speech。代码写法见下方的请求示例。

Grok Voice TTS 支持哪些操作?

Grok Voice TTS 支持 文本转语音。选了操作,上面会显示对应的端点和请求示例。

Grok Voice TTS 对比

资料来源

审阅于 2026年10月2日

更多 Grok Voice 模型

相关模型