每次请求可选择 Auto、TokenLab Verified 或 Official,并查看对应价格。查看更新

xAI: Grok Voice Latest

Grok Voice Latest 提供可选择音色并结合工具交互的语音会话,适合需要把口头回复与应用中的操作和信息连接起来的语音助手。
对比模型
grok-voice-latest
可用xAI音频同步新发布
价格
起 $0.001333
发布日期
2026年4月23日
模态
音频

Grok Voice Latest 简介

Grok Voice Latest 是 xAI 当前实时语音到语音模型的浮动别名,用于通过 WebSocket 会话进行语音对话。审阅时它指向 grok-voice-think-fast-2.0。希望语音助手不改代码就跟上 xAI 的改进时选它;行为必须固定时,请固定使用带版本的模型。

擅长的任务

  • 这是 xAI 推荐给希望自动获得模型升级的语音智能体的别名,会话配置不用改。
  • 会话支持内置或自定义声音、服务端语音活动检测(用于轮流发言),以及转写用的语言提示。
  • 智能体可以调用网页和 X 搜索、针对文档集合的文件搜索、远程 MCP 服务器和自定义函数工具。
  • 连接断开后,会话可以复用对话 ID 来恢复,适合电话和移动端客户端。

什么情况换别的模型

  • 别名会移动,升级后声音、语速或措辞可能变化;经过回归测试的产品请固定带版本的模型。
  • 它只处理实时音频会话;转写存储的录音或朗读准备好的文本,需要语音识别或语音合成模型。

快速上手

  1. 创建 API 密钥

    在 Console 生成一把密钥,平台上的模型都能用。

  2. 发送第一个请求

    复制你所用语言的示例代码,向该端点发起请求。

    实时WebSocket
    WS/v1/realtime
    // npm install ws
    import WebSocket from 'ws';
    
    const socket = new WebSocket("wss://api.tokenlab.sh/v1/realtime?model=grok-voice-latest", {
      headers: { Authorization: "Bearer sk-xxx" }
    });
    
    socket.on('open', () => {
      // Send the input events supported by this model with socket.send(...).
      // https://tokenlab.sh/docs/en/api-reference/realtime/connect
    });
    socket.on('message', (data) => console.log(data.toString()));
    socket.on('error', (error) => console.error(error));
    socket.on('close', (code, reason) => console.log(code, reason.toString()));
    
    // Close the session when finished.
    process.on('SIGINT', () => socket.close());

价格

官方价格是模型厂商公开的基线价,TokenLab 价格是用这个模型时实际的计费价。

Audio Duration

每秒
官方价格
$0.001333
Official
$0.001333
折扣
—

用量与动态

成功率是请求完成的比例;延迟是拿到一次完整响应要花的时间,P95 表示 95% 的请求都在这个时间内完成。

用量与可用性

最近 24 小时
请求
成功率
P95 延迟
总 token 数
模型表现
达到隐私和数据量阈值后,指标才会显示。

数据来自汇总的用户请求,不含状态检查。

直接在 Console 里试

Grok Voice Latest 已在 Console 备好,提示词已填好,可以直接修改或发送。

帮我用 grok-voice-latest 发起一条简短的音频请求,接口是 /v1/realtime。返回结果和费用。

使用场景

  • 电话与呼叫中心智能体

    通过电话编解码器接听来电,用函数工具查询账户,请求超出政策范围时把来电者转给真人。

  • 应用内语音助手

    让用户对着产品说话,用临时令牌避免 API 密钥暴露在客户端,由工具访问应用背后的数据。

  • 实时通话中的固定播报

    在通话中插入一句强制、固定的合规提示,其余对话由模型处理。

提示词示例

你是一家牙科诊所的预约助手。问候来电者,询问需求,并用日历工具提供最近的两个空档。

来电者换成西班牙语时,你也换成西班牙语,回答控制在两句话内,结束通话前确认订单总额。

搜索我们的退货政策集合,用语音回答客户的问题,并说明你用的是哪份文档。

FAQ

grok-voice-latest 运行的是哪个模型?

它是一个别名,目前指向 grok-voice-think-fast-2.0,也就是 xAI Grok Voice 套件中的实时语音到语音模型。xAI 建议用别名自动获得改进,所以底层版本可能随时间变化。

什么时候该固定版本,而不是用别名?

你已经测试过提示词、声音选择和工具行为、并需要它们保持稳定时,固定带版本的模型。原型和更看重不重新部署就能获得升级的产品,用别名,不要求精确可复现。

会话使用什么音频格式?

会话支持采样率 8 kHz 到 48 kHz 的 PCM,电话用的 G.711 mu-law 和 A-law,以及 Opus。音频以 base64 的 JSON 消息或二进制 WebSocket 帧传输。

语音智能体能调用工具吗?

能,根据 xAI 的语音文档:网页和 X 搜索、文件搜索、远程 MCP 服务器,以及你用 JSON schema 定义的自有函数工具。请确认你的集成在会话初始化时传入了工具定义。

断线后能继续对话吗?

能。会话恢复把之前的发言轮次缓存在一个对话 ID 之下,所以网络中断后重新连接的客户端可以继续同一段对话,而不用重新开始。

Grok Voice Latest 的费用是多少?

在 TokenLab 上,Grok Voice Latest 的价格为 $0.001333 每秒。完整明细见上方价格表。 价格因计费单位、规格和用量而异。请在模型的详细定价中对比相同条件下的费率;单一费率不代表总价。

Grok Voice Latest 应该使用哪个端点?

Grok Voice Latest 使用 https://api.tokenlab.sh/v1/realtime。代码写法见下方的请求示例。

Grok Voice Latest 支持哪些操作?

Grok Voice Latest 支持 实时。选了操作,上面会显示对应的端点和请求示例。

Grok Voice Latest 对比

用到 Grok Voice Latest 的指南

资料来源

审阅于 2026年10月2日

更多 Grok Voice 模型

相关模型