為每個請求選擇 Auto、TokenLab Verified 或 Official,並預先顯示價格。查看最新動態

xAI: Grok Voice STT

Grok Voice STT 將錄製的音訊轉換為文字。語言提示與時間戳記控制使其適用於將作為字幕、搜尋或後續文字分析步驟的轉錄內容。
比較模型
grok-voice-stt
可用xAI語音轉文字同步
價格
起 $0.000028
模態
音訊

關於 Grok Voice STT

Grok Voice STT 是 xAI 的語音轉文字模型,可將錄製或串流的音訊轉換為文字轉錄稿。它接受常見的音訊檔案格式,回傳單字級時間戳記,可以分離說話者和聲道,並根據語言格式化數字和貨幣。適用於字幕、可搜尋的會議記錄以及供後續文字分析使用的通話轉錄稿。

適用場景

  • 單字級時間戳記使得從轉錄稿製作字幕、跳轉時刻搜尋和字幕檔案變得直接簡單。
  • 說話者分離 (Diarization) 和多聲道轉錄可區分會議和雙向通話錄音中誰說了什麼。
  • 語言提示和自訂關鍵詞列表可將識別導向產品名稱和專業術語。
  • 文字格式化功能會按照口語書寫方式呈現數字、日期和貨幣。

其他選擇建議

  • 它僅產生轉錄稿;若要從音訊進行摘要、翻譯或回答問題,則需在之後使用文字模型。
  • 非常嘈雜的錄音可能需要調整語音檢測閾值,或在達到可接受的準確度前先進行降噪處理。

入門指南

  1. 建立 API 金鑰

    請至 Console 建立金鑰,即可在平台上使用各類模型。

  2. 發送您的第一個請求

    複製您所選語言的範例,並針對端點執行它。

    語音轉文字TokenLab 端點
    POST/v1/audio/transcriptions
    curl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \
      -H "Authorization: Bearer sk-xxx" \
      -F file="@audio.mp3" \
      -F operation="stt" \
      -F response_format="json" \
      -F model="grok-voice-stt" \
      -F language="en"

定價

Official 價格為模型開發商的公開基準價。TokenLab 價格則為您在 TokenLab 使用該模型的實際費用。

定價

每秒
Official
$0.000028每秒
Official 定價
$0.000028每秒

使用量與活動

成功率是請求完成的比例;延遲是一次完整回應所需的時間,P95 表示 95% 的請求在該時間內完成。

用量與可用性

過去 24 小時
請求數
成功率
P95 延遲
總 Token 用量
模型效能
當達到隱私權與資料量的門檻後,指標才會顯示。

資料基於彙總的使用者請求,不包含狀態檢查。

直接在 Console 裡試

在 Console 中開啟 Grok Voice STT,並準備好編輯或發送提示詞。

協助我使用 grok-voice-stt 透過 /v1/audio/transcriptions 進行音訊請求,並顯示結果與成本。

應用情境

  • 會議轉錄稿

    轉錄帶有說話者標籤的錄音通話,然後將文字傳遞給摘要工具以提取行動項目。

  • 影片字幕

    利用單字時間資訊,從上傳影片的音軌產生帶有時間軸的字幕。

  • 客服中心品質審查

    轉錄將代理與客戶分開在不同聲道的雙聲道錄音,然後掃描合規用語。

提示詞範例

轉錄這段 45 分鐘的英語播客,並標註單字時間戳記與說話者。

轉錄隨附的客戶通話,並使用關鍵詞「Zyntra」、「OmniPlan」和「SLA」來引導識別。

將這段西班牙語語音備忘錄轉換為文字,並將金額格式化為貨幣。

FAQ

Grok Voice STT 有什麼功能?

它將音訊轉換為文字。您發送檔案或串流音訊,它會回傳一份轉錄稿,根據您設定的選項,該轉錄稿可包含單字級時間戳記、說話者標籤和各聲道的文字。

它能讀取哪些音訊格式?

xAI 列出了 12 種格式,包括 MP3、WAV、FLAC 和 Opus,檔案大小上限為 500 MB。原始 PCM、mu-law 和 A-law 音訊需要明確的編碼參數。

它支援即時轉錄嗎?

支援。WebSocket 端點會串流中間結果,並使用 Smart Turn 句尾檢測來區分自然停頓與句子結束,這能減少過早截斷的情況。

它涵蓋多少種語言?

xAI 文件記錄了超過 25 種語言的轉錄和特定語言格式化。當您知道語言時,請傳遞語言提示,這樣識別過程就不需要進行猜測。

它能區分不同的說話者嗎?

可以,說話者分離功能會標記錄音中的說話者,而多聲道模式最多可處理八個獨立聲道,這非常適合每一方佔用一個聲道的通話錄音。

Grok Voice STT 的費用是多少?

在 TokenLab 上,Grok Voice STT 價格為 $0.000028 每秒。完整明細見上方價格表。

Grok Voice STT 應該使用哪一個端點?

請使用 https://api.tokenlab.sh/v1/audio/transcriptions 進行 Grok Voice STT 的呼叫。下方的請求範例展示了對應的程式碼格式。

Grok Voice STT 支援哪些操作?

Grok Voice STT 支援 語音轉文字。請在上方選擇一項操作以查看其端點與請求範例。

比較 Grok Voice STT

來源

更新於 2026年10月2日

更多來自 Grok Voice 的模型

相關模型