每次请求可选择 Auto、TokenLab Verified 或 Official,并查看对应价格。查看更新

xAI: Grok Voice Think Fast 2.0

Grok Voice Think Fast 2.0 面向实时语音对话,适合需要跟随用户持续交流的语音界面,可作为交互式口语助手的选型对象。
对比模型
grok-voice-think-fast-2.0
可用xAI音频同步
价格
起 $0.001333
模态
音频

Grok Voice Think Fast 2.0 简介

Grok Voice Think Fast 2.0 是 xAI 用于实时双向对话的实时语音模型,为必须跟上说话人节奏、而不是照着准备好的稿子朗读的助手而设计。它是 grok-voice-latest 别名背后带版本的模型。产品的语音回复需要固定的模型版本时,请使用这个确切的 ID。

擅长的任务

  • 它是 xAI 语音智能体别名背后固定的带版本发行版,在你换掉它之前,行为始终对应同一个模型。
  • 服务端语音活动检测负责管理轮流发言,客户端只需流式传入麦克风音频,不用自己写停顿逻辑。
  • 按回复设置的指令,让会话可以只对某一次回复更改系统提示词,例如解释退款时切换语气。
  • 发音替换可以纠正姓名和产品术语的读法,不会改动转写文本。

什么情况换别的模型

  • 它是对话式的语音到语音模型,文件的批量转写和长文本旁白更适合用专门的语音模型。
  • 为实时音频保持连接需要 WebSocket 客户端;普通的请求—响应调用驱动不了它。

快速上手

  1. 创建 API 密钥

    在 Console 生成一把密钥,平台上的模型都能用。

  2. 发送第一个请求

    复制你所用语言的示例代码,向该端点发起请求。

    音频Chat Completions API
    POST/v1/chat/completions
    curl https://api.tokenlab.sh/v1/chat/completions \
      -H "Content-Type: application/json" \
      -H "Authorization: Bearer sk-xxx" \
      -d '{
        "model": "grok-voice-think-fast-2.0",
        "messages": [
          {"role": "user", "content": "Hello!"}
        ]
      }'

价格

官方价格是模型厂商公开的基线价,TokenLab 价格是用这个模型时实际的计费价。

Audio Duration

每秒
官方价格
$0.001333
Official
$0.001333
折扣
—

用量与动态

成功率是请求完成的比例;延迟是拿到一次完整响应要花的时间,P95 表示 95% 的请求都在这个时间内完成。

用量与可用性

最近 24 小时
请求
成功率
P95 延迟
总 token 数
模型表现
达到隐私和数据量阈值后,指标才会显示。

数据来自汇总的用户请求,不含状态检查。

使用场景

  • 替代交互式语音应答

    取代按菜单操作的电话树,来电者直接说出问题,由智能体转接或解决。

  • 语言练习伙伴

    用目标语言进行语音对话,当场纠正错误,学习者要求时调整语速。

  • 免手动的现场助手

    让技师用语音询问手册里的内容,双手不离设备就能听到回答。

提示词示例

你是一家网络运营商的客服,语气沉稳。询问账户邮编,然后带着来电者重启路由器。

把我们的品牌 'Zyntra' 读作 ZIN-tra,保持友好的语气,绝不在来电者说话途中打断。

扮演葡萄牙语老师。说慢一点,把我说的句子纠正后重复一遍,每轮问一个后续问题。

FAQ

grok-voice-think-fast-2.0 和 grok-voice-latest 有什么区别?

grok-voice-think-fast-2.0 是一个具体的模型版本,grok-voice-latest 是目前指向它的别名。别名会移到更新的版本;带版本的名称则保持在你测试过的那个版本上。

Grok Voice Think Fast 2.0 是语音合成模型吗?

不是。它在实时会话中听并回答,输入音频,产出语音回复。要把准备好的文本转成音频,用 Grok Voice TTS;转写录音用 Grok Voice STT。

它怎么判断我说完了?

会话可以启用服务端语音活动检测,它会检测用户发言的结束并开始回复。如果你的客户端已经有按键说话,也可以自己管理发言轮次。

可以用哪些声音?

会话可以在 xAI 的内置声音中选择,默认是 eve,也可以用一段简短参考录音克隆出的自定义声音。内置声音能说所有受支持的语言。

Grok Voice Think Fast 2.0 的费用是多少?

在 TokenLab 上,Grok Voice Think Fast 2.0 的价格为 $0.001333 每秒。完整明细见上方价格表。 价格因计费单位、规格和用量而异。请在模型的详细定价中对比相同条件下的费率;单一费率不代表总价。

Grok Voice Think Fast 2.0 应该使用哪个端点?

Grok Voice Think Fast 2.0 使用 https://api.tokenlab.sh/v1/chat/completions。代码写法见下方的请求示例。

Grok Voice Think Fast 2.0 对比

资料来源

审阅于 2026年10月2日

更多 Grok Voice 模型

相关模型