每次请求可选择 Auto、TokenLab Verified 或 Official,并查看对应价格。查看更新

xAI: Grok Voice STT

Grok Voice STT 将录音转为文字,可结合语言提示和时间戳选项,用于字幕制作、语音内容检索及后续文本分析。
对比模型
grok-voice-stt
可用xAI语音转文本同步
价格
起 $0.000028
模态
音频

Grok Voice STT 简介

Grok Voice STT 是 xAI 的语音识别模型,把录制的或流式的音频转成文本。它接受常见的音频文件格式,返回逐词时间戳,可以区分说话人和声道,并按语言格式化数字和货币。适用于字幕、可搜索的会议记录,以及供后续文本分析使用的通话转写。

擅长的任务

  • 逐词时间戳让你可以直接用转写文本做字幕、跳转到某一刻的搜索和字幕文件。
  • 说话人区分和多声道转写,能在会议和双方通话录音中分清谁说了什么。
  • 语言提示和自定义关键词列表,引导识别偏向产品名和行话。
  • 文本格式化按口语对应语言的写法呈现数字、日期和货币。

什么情况换别的模型

  • 它只生成转写文本;对音频做摘要、翻译或问答,需要在它之后再接文本模型。
  • 噪声很大的录音可能需要调整语音检测阈值或提供更干净的输入,准确率才能接受。

快速上手

  1. 创建 API 密钥

    在 Console 生成一把密钥,平台上的模型都能用。

  2. 发送第一个请求

    复制你所用语言的示例代码,向该端点发起请求。

    语音转文字TokenLab 端点
    POST/v1/audio/transcriptions
    curl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \
      -H "Authorization: Bearer sk-xxx" \
      -F file="@audio.mp3" \
      -F operation="stt" \
      -F response_format="json" \
      -F model="grok-voice-stt" \
      -F language="en"

价格

官方价格是模型厂商公开的基线价,TokenLab 价格是用这个模型时实际的计费价。

价格

每秒
Official
$0.000028每秒
官方价格
$0.000028每秒

用量与动态

成功率是请求完成的比例;延迟是拿到一次完整响应要花的时间,P95 表示 95% 的请求都在这个时间内完成。

用量与可用性

最近 24 小时
请求
成功率
P95 延迟
总 token 数
模型表现
达到隐私和数据量阈值后,指标才会显示。

数据来自汇总的用户请求,不含状态检查。

直接在 Console 里试

Grok Voice STT 已在 Console 备好,提示词已填好,可以直接修改或发送。

帮我用 grok-voice-stt 发起一条简短的音频请求,接口是 /v1/audio/transcriptions。返回结果和费用。

使用场景

  • 会议转写

    转写带说话人标注的通话录音,再把文本交给摘要模型提取行动项。

  • 视频字幕

    利用逐词时间,根据上传视频的音轨生成带时间的字幕。

  • 呼叫中心质检

    转写坐席和客户分在不同声道的双声道录音,再扫描其中的合规话术。

提示词示例

转写这期 45 分钟的播客,语言为英语,带逐词时间戳并标注说话人。

转写附上的客户通话,用关键词 'Zyntra'、'OmniPlan' 和 'SLA' 来引导识别。

把这条西班牙语语音备忘录转成文本,并把金额格式化为货币。

FAQ

Grok Voice STT 是做什么的?

它把音频转成文本。你发送文件或流式传入音频,它返回转写结果,根据你的选项,可以包含逐词时间戳、说话人标签和按声道区分的文本。

它能读取哪些音频格式?

xAI 列出了十二种格式,包括 MP3、WAV、FLAC 和 Opus,文件大小上限为 500 MB。原始的 PCM、mu-law 和 A-law 音频需要明确的编码参数。

它支持实时转写吗?

支持。WebSocket 端点会流式返回中间结果,并用 Smart Turn 发言结束检测区分自然停顿和句子结束,减少过早截断。

它涵盖多少种语言?

xAI 文档标明转写和按语言格式化支持 25 种以上语言。知道语言时请传入语言提示,这样识别就不必去猜。

它能区分说话人吗?

能,说话人区分会在一段录音中标注说话人,多声道模式最多处理八个独立声道,适合每一方各占一个声道的通话录音。

Grok Voice STT 的费用是多少?

在 TokenLab 上,Grok Voice STT 的价格为 $0.000028 每秒。完整明细见上方价格表。

Grok Voice STT 应该使用哪个端点?

Grok Voice STT 使用 https://api.tokenlab.sh/v1/audio/transcriptions。代码写法见下方的请求示例。

Grok Voice STT 支持哪些操作?

Grok Voice STT 支持 语音转文字。选了操作,上面会显示对应的端点和请求示例。

Grok Voice STT 对比

资料来源

审阅于 2026年10月2日

更多 Grok Voice 模型

相关模型