為每個請求選擇 Auto、TokenLab Verified 或 Official,並預先顯示價格。查看最新動態

xAI: Grok Voice Think Fast 2.0

Grok Voice Think Fast 2.0 是一款用於即時對話的語音模型。它是語音介面的候選模型,助理需跟上持續進行的交流,而非僅僅朗讀準備好的腳本。
比較模型
grok-voice-think-fast-2.0
可用xAI音訊同步
價格
起 $0.001333
模態
音訊

關於 Grok Voice Think Fast 2.0

Grok Voice Think Fast 2.0 是 xAI 的即時語音模型,專為需要跟上說話者節奏而非朗讀預備講稿的助理所設計,適用於即時雙向對話。它是 grok-voice-latest 別名背後的版本化模型。當產品需要固定的模型版本來進行語音回覆時,請使用此確切 ID。

適用場景

  • 這是 xAI 語音代理別名背後的固定版本化發布,因此在您切換模型之前,行為將始終保持一致。
  • 伺服器端的語音活動偵測可管理對話輪替,因此用戶端無需自備暫停邏輯,即可直接串流麥克風音訊。
  • 單次回應指令允許會話針對單一回覆變更系統提示詞,例如在解釋退款時切換語氣。
  • 發音替換功能可在不更改文字記錄的情況下,修正名稱與產品術語的讀音。

其他選擇建議

  • 這是一個對話式語音轉語音模型,因此檔案的批次轉錄與長文本旁白更適合使用專用的語音模型。
  • 保持連線以進行即時音訊傳輸需要 WebSocket 用戶端;單純的請求與回應呼叫無法驅動此功能。

入門指南

  1. 建立 API 金鑰

    請至 Console 建立金鑰,即可在平台上使用各類模型。

  2. 發送您的第一個請求

    複製您所選語言的範例,並針對端點執行它。

    音訊Chat Completions API
    POST/v1/chat/completions
    curl https://api.tokenlab.sh/v1/chat/completions \
      -H "Content-Type: application/json" \
      -H "Authorization: Bearer sk-xxx" \
      -d '{
        "model": "grok-voice-think-fast-2.0",
        "messages": [
          {"role": "user", "content": "Hello!"}
        ]
      }'

定價

Official 價格為模型開發商的公開基準價。TokenLab 價格則為您在 TokenLab 使用該模型的實際費用。

Audio Duration

每秒
Official 定價
$0.001333
Official
$0.001333
折扣
—

使用量與活動

成功率是請求完成的比例;延遲是一次完整回應所需的時間,P95 表示 95% 的請求在該時間內完成。

用量與可用性

過去 24 小時
請求數
成功率
P95 延遲
總 Token 用量
模型效能
當達到隱私權與資料量的門檻後,指標才會顯示。

資料基於彙總的使用者請求,不包含狀態檢查。

應用情境

  • 互動式語音應答替換方案

    以直接陳述問題的來電者取代選單式電話語音系統,並由代理程式進行轉接或解決問題。

  • 語言練習夥伴

    以目標語言進行口語對話,並在學習者要求時大聲糾正錯誤及調整語速。

  • 免持現場助理

    讓技術人員透過語音詢問手冊相關問題,並在雙手操作設備的同時聆聽答案。

提示詞範例

您是一位冷靜的網路供應商支援專員。請詢問帳戶郵遞區號,然後引導來電者重新啟動路由器。

將我們的品牌「Zyntra」讀作 ZIN-tra,保持友善語氣,且絕不中途打斷來電者說話。

擔任葡萄牙語導師。請說慢一點,重複我修正後的句子,並在每輪對話中提出一個後續問題。

FAQ

grok-voice-think-fast-2.0 與 grok-voice-latest 之間有什麼區別?

grok-voice-think-fast-2.0 是特定的模型版本,而 grok-voice-latest 是一個目前指向該版本的別名。別名會隨新版本發布而更新;而帶有日期的名稱則會固定在您測試時的版本上。

Grok Voice Think Fast 2.0 是文字轉語音模型嗎?

不是。它是在即時會話中進行聆聽與回答,接收音訊並產生語音回覆。若要將準備好的文字轉為音訊,請使用 Grok Voice TTS;若要轉錄錄音檔,請使用 Grok Voice STT。

它如何判斷我何時說完話?

會話可啟用伺服器端語音活動偵測,該功能可偵測使用者對話的結束並開始回覆。如果您的用戶端已有按鍵通話 (push-to-talk) 功能,您也可以自行管理對話輪替。

它可以使用哪些聲音?

會話可在 xAI 的內建聲音中選擇(預設為 eve),或使用從簡短參考錄音中複製的自訂聲音。內建聲音支援所有支援的語言。

Grok Voice Think Fast 2.0 的費用是多少?

在 TokenLab 上,Grok Voice Think Fast 2.0 價格為 $0.001333 每秒。完整明細見上方價格表。 價格因計費單位、規格和用量而異。請在模型的詳細定價中比較相同條件下的費率;單一費率不代表總價。

Grok Voice Think Fast 2.0 應該使用哪一個端點?

請使用 https://api.tokenlab.sh/v1/chat/completions 進行 Grok Voice Think Fast 2.0 的呼叫。下方的請求範例展示了對應的程式碼格式。

比較 Grok Voice Think Fast 2.0

來源

更新於 2026年10月2日

更多來自 Grok Voice 的模型

相關模型