xAI: Grok Voice Latest
grok-voice-latest- 价格
- 起 $0.001333
- 发布日期
- 2026年4月23日
- 模态
- 音频
Grok Voice Latest 简介
Grok Voice Latest 是 xAI 当前实时语音到语音模型的浮动别名,用于通过 WebSocket 会话进行语音对话。审阅时它指向 grok-voice-think-fast-2.0。希望语音助手不改代码就跟上 xAI 的改进时选它;行为必须固定时,请固定使用带版本的模型。
擅长的任务
- 这是 xAI 推荐给希望自动获得模型升级的语音智能体的别名,会话配置不用改。
- 会话支持内置或自定义声音、服务端语音活动检测(用于轮流发言),以及转写用的语言提示。
- 智能体可以调用网页和 X 搜索、针对文档集合的文件搜索、远程 MCP 服务器和自定义函数工具。
- 连接断开后,会话可以复用对话 ID 来恢复,适合电话和移动端客户端。
什么情况换别的模型
- 别名会移动,升级后声音、语速或措辞可能变化;经过回归测试的产品请固定带版本的模型。
- 它只处理实时音频会话;转写存储的录音或朗读准备好的文本,需要语音识别或语音合成模型。
快速上手
创建 API 密钥
在 Console 生成一把密钥,平台上的模型都能用。
发送第一个请求
复制你所用语言的示例代码,向该端点发起请求。
实时WebSocketWS/v1/realtime// npm install ws import WebSocket from 'ws'; const socket = new WebSocket("wss://api.tokenlab.sh/v1/realtime?model=grok-voice-latest", { headers: { Authorization: "Bearer sk-xxx" } }); socket.on('open', () => { // Send the input events supported by this model with socket.send(...). // https://tokenlab.sh/docs/en/api-reference/realtime/connect }); socket.on('message', (data) => console.log(data.toString())); socket.on('error', (error) => console.error(error)); socket.on('close', (code, reason) => console.log(code, reason.toString())); // Close the session when finished. process.on('SIGINT', () => socket.close());
价格
官方价格是模型厂商公开的基线价,TokenLab 价格是用这个模型时实际的计费价。
Audio Duration
每秒- 官方价格
- $0.001333
- Official
- $0.001333
- 折扣
- —
| 官方价格每秒 | Official每秒 | 折扣 | |
|---|---|---|---|
| Audio Duration | $0.001333 | $0.001333 | — |
用量与动态
成功率是请求完成的比例;延迟是拿到一次完整响应要花的时间,P95 表示 95% 的请求都在这个时间内完成。
用量与可用性
最近 24 小时- 请求
- 成功率
- P95 延迟
- 总 token 数
数据来自汇总的用户请求,不含状态检查。
直接在 Console 里试
Grok Voice Latest 已在 Console 备好,提示词已填好,可以直接修改或发送。
帮我用 grok-voice-latest 发起一条简短的音频请求,接口是 /v1/realtime。返回结果和费用。
使用场景
电话与呼叫中心智能体
通过电话编解码器接听来电,用函数工具查询账户,请求超出政策范围时把来电者转给真人。
应用内语音助手
让用户对着产品说话,用临时令牌避免 API 密钥暴露在客户端,由工具访问应用背后的数据。
实时通话中的固定播报
在通话中插入一句强制、固定的合规提示,其余对话由模型处理。
提示词示例
你是一家牙科诊所的预约助手。问候来电者,询问需求,并用日历工具提供最近的两个空档。
来电者换成西班牙语时,你也换成西班牙语,回答控制在两句话内,结束通话前确认订单总额。
搜索我们的退货政策集合,用语音回答客户的问题,并说明你用的是哪份文档。
FAQ
grok-voice-latest 运行的是哪个模型?
它是一个别名,目前指向 grok-voice-think-fast-2.0,也就是 xAI Grok Voice 套件中的实时语音到语音模型。xAI 建议用别名自动获得改进,所以底层版本可能随时间变化。
什么时候该固定版本,而不是用别名?
你已经测试过提示词、声音选择和工具行为、并需要它们保持稳定时,固定带版本的模型。原型和更看重不重新部署就能获得升级的产品,用别名,不要求精确可复现。
会话使用什么音频格式?
会话支持采样率 8 kHz 到 48 kHz 的 PCM,电话用的 G.711 mu-law 和 A-law,以及 Opus。音频以 base64 的 JSON 消息或二进制 WebSocket 帧传输。
语音智能体能调用工具吗?
能,根据 xAI 的语音文档:网页和 X 搜索、文件搜索、远程 MCP 服务器,以及你用 JSON schema 定义的自有函数工具。请确认你的集成在会话初始化时传入了工具定义。
断线后能继续对话吗?
能。会话恢复把之前的发言轮次缓存在一个对话 ID 之下,所以网络中断后重新连接的客户端可以继续同一段对话,而不用重新开始。
Grok Voice Latest 的费用是多少?
在 TokenLab 上,Grok Voice Latest 的价格为 $0.001333 每秒。完整明细见上方价格表。 价格因计费单位、规格和用量而异。请在模型的详细定价中对比相同条件下的费率;单一费率不代表总价。
Grok Voice Latest 应该使用哪个端点?
Grok Voice Latest 使用 https://api.tokenlab.sh/v1/realtime。代码写法见下方的请求示例。
Grok Voice Latest 支持哪些操作?
Grok Voice Latest 支持 实时。选了操作,上面会显示对应的端点和请求示例。
Grok Voice Latest 对比
用到 Grok Voice Latest 的指南
资料来源
审阅于 2026年10月2日