xAI: Grok Voice STT
grok-voice-stt- 价格
- 起 $0.000028
- 模态
- 音频
Grok Voice STT 简介
Grok Voice STT 是 xAI 的语音识别模型,把录制的或流式的音频转成文本。它接受常见的音频文件格式,返回逐词时间戳,可以区分说话人和声道,并按语言格式化数字和货币。适用于字幕、可搜索的会议记录,以及供后续文本分析使用的通话转写。
擅长的任务
- 逐词时间戳让你可以直接用转写文本做字幕、跳转到某一刻的搜索和字幕文件。
- 说话人区分和多声道转写,能在会议和双方通话录音中分清谁说了什么。
- 语言提示和自定义关键词列表,引导识别偏向产品名和行话。
- 文本格式化按口语对应语言的写法呈现数字、日期和货币。
什么情况换别的模型
- 它只生成转写文本;对音频做摘要、翻译或问答,需要在它之后再接文本模型。
- 噪声很大的录音可能需要调整语音检测阈值或提供更干净的输入,准确率才能接受。
快速上手
创建 API 密钥
在 Console 生成一把密钥,平台上的模型都能用。
发送第一个请求
复制你所用语言的示例代码,向该端点发起请求。
语音转文字TokenLab 端点POST/v1/audio/transcriptionscurl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \ -H "Authorization: Bearer sk-xxx" \ -F file="@audio.mp3" \ -F operation="stt" \ -F response_format="json" \ -F model="grok-voice-stt" \ -F language="en"
价格
官方价格是模型厂商公开的基线价,TokenLab 价格是用这个模型时实际的计费价。
价格
每秒- Official
- $0.000028每秒
- 官方价格
- $0.000028每秒
| 官方价格每秒 | Official每秒 | 折扣 | |
|---|---|---|---|
| 价格 | $0.000028每秒 | $0.000028每秒 | — |
用量与动态
成功率是请求完成的比例;延迟是拿到一次完整响应要花的时间,P95 表示 95% 的请求都在这个时间内完成。
用量与可用性
最近 24 小时- 请求
- 成功率
- P95 延迟
- 总 token 数
数据来自汇总的用户请求,不含状态检查。
直接在 Console 里试
Grok Voice STT 已在 Console 备好,提示词已填好,可以直接修改或发送。
帮我用 grok-voice-stt 发起一条简短的音频请求,接口是 /v1/audio/transcriptions。返回结果和费用。
使用场景
会议转写
转写带说话人标注的通话录音,再把文本交给摘要模型提取行动项。
视频字幕
利用逐词时间,根据上传视频的音轨生成带时间的字幕。
呼叫中心质检
转写坐席和客户分在不同声道的双声道录音,再扫描其中的合规话术。
提示词示例
转写这期 45 分钟的播客,语言为英语,带逐词时间戳并标注说话人。
转写附上的客户通话,用关键词 'Zyntra'、'OmniPlan' 和 'SLA' 来引导识别。
把这条西班牙语语音备忘录转成文本,并把金额格式化为货币。
FAQ
Grok Voice STT 是做什么的?
它把音频转成文本。你发送文件或流式传入音频,它返回转写结果,根据你的选项,可以包含逐词时间戳、说话人标签和按声道区分的文本。
它能读取哪些音频格式?
xAI 列出了十二种格式,包括 MP3、WAV、FLAC 和 Opus,文件大小上限为 500 MB。原始的 PCM、mu-law 和 A-law 音频需要明确的编码参数。
它支持实时转写吗?
支持。WebSocket 端点会流式返回中间结果,并用 Smart Turn 发言结束检测区分自然停顿和句子结束,减少过早截断。
它涵盖多少种语言?
xAI 文档标明转写和按语言格式化支持 25 种以上语言。知道语言时请传入语言提示,这样识别就不必去猜。
它能区分说话人吗?
能,说话人区分会在一段录音中标注说话人,多声道模式最多处理八个独立声道,适合每一方各占一个声道的通话录音。
Grok Voice STT 的费用是多少?
在 TokenLab 上,Grok Voice STT 的价格为 $0.000028 每秒。完整明细见上方价格表。
Grok Voice STT 应该使用哪个端点?
Grok Voice STT 使用 https://api.tokenlab.sh/v1/audio/transcriptions。代码写法见下方的请求示例。
Grok Voice STT 支持哪些操作?
Grok Voice STT 支持 语音转文字。选了操作,上面会显示对应的端点和请求示例。
Grok Voice STT 对比
资料来源
审阅于 2026年10月2日