為每個請求選擇 Auto、TokenLab Verified 或 Official,並預先顯示價格。查看最新動態

xAI: Grok Voice TTS

Grok Voice TTS 使用選定的語音與語言將書面文字轉換為語音。它適合在地化旁白、語音通知以及需要將準備好的文字呈現為音訊回應的應用程式。
比較模型
grok-voice-tts
可用xAI文字轉語音同步
輸入 / 輸出
$15.00 / $0.00
模態
音訊

關於 Grok Voice TTS

Grok Voice TTS 是 xAI 的文字轉語音模型,能將書面文字以選定的聲音與語言渲染為語音音訊。內嵌標籤(如暫停、笑聲與耳語)可塑造表達方式。適用於旁白、語音通知以及無需即時對話的在地化音訊回答。

適用場景

  • 內嵌語音標籤(如 [pause] 和 [laugh])以及包裹標籤(如 whisper)可在文字內部控制表達方式。
  • 所有內建聲音均支援所提供的語言,因此單一聲音識別碼可用於同一內容的在地化版本。
  • 自訂聲音可從簡短的參考片段中複製,以用於品牌或角色配音。
  • 可回傳字元級時間戳記,用於將字幕或唇形同步至音訊。

其他選擇建議

  • 它朗讀的是固定文字;若來電者需要中斷或回應,則需使用對話式語音模型。
  • 長篇講稿的輸出品質取決於原始文字中的標點符號與標籤,未經編輯的機器文字聽起來可能會較為平淡。

入門指南

  1. 建立 API 金鑰

    請至 Console 建立金鑰,即可在平台上使用各類模型。

  2. 發送您的第一個請求

    複製您所選語言的範例,並針對端點執行它。

    文字轉語音TokenLab 端點
    POST/v1/audio/speech
    curl -X POST "https://api.tokenlab.sh/v1/audio/speech" \
      -H "Authorization: Bearer sk-xxx" \
      -H "Content-Type: application/json" \
      -d '{
      "language_code": "en",
      "operation": "tts",
      "response_format": "mp3",
      "voice": "eve",
      "model": "grok-voice-tts",
      "input": "Hello from TokenLab."
    }'

定價

Official 價格為模型開發商的公開基準價。TokenLab 價格則為您在 TokenLab 使用該模型的實際費用。

定價

每百萬字元
Official
輸入$15.00/百萬字元輸出$0.00/百萬字元
Official 定價
輸入$15.00/百萬字元輸出$0.00/百萬字元

使用量與活動

成功率是請求完成的比例;延遲是一次完整回應所需的時間,P95 表示 95% 的請求在該時間內完成。

用量與可用性

過去 24 小時
請求數
成功率
P95 延遲
總 Token 用量
模型效能
當達到隱私權與資料量的門檻後,指標才會顯示。

資料基於彙總的使用者請求,不包含狀態檢查。

直接在 Console 裡試

在 Console 中開啟 Grok Voice TTS,並準備好編輯或發送提示詞。

協助我使用 grok-voice-tts 透過 /v1/audio/speech 進行音訊請求,並顯示結果與成本。

應用情境

  • 旁白文章與課程

    將完成的文章或課程講稿轉為音軌,並使用暫停來區隔章節。

  • 語音快訊

    透過電話編解碼器以使用者的語言朗讀訂單更新或安全通知。

  • 在地化產品影片

    使用同一種聲音以多種語言為同一講稿配音,然後利用時間戳記對齊字幕。

提示詞範例

用溫暖、穩定的聲音朗讀這段文字,並在每個句子後加入短暫的 [pause]。

用法語朗讀以下通知,然後用德語重複,並使用相同的聲音。

<whisper>您的包裹已寄出。</whisper> [pause] 預計將於週四送達。

FAQ

Grok Voice TTS 的功能是什麼?

它將文字轉換為語音音訊。您選擇聲音、語言代碼(選填)與輸出格式,它會回傳該文字的音訊,包含您內嵌編寫的任何表達標籤。

它可以產生哪些音訊格式?

MP3、WAV 與原始 PCM,以及電話編解碼器 mu-law 與 A-law,取樣率從 8 kHz 到 48 kHz。電話編解碼器適用於電話系統;MP3 適用於網頁與行動裝置播放。

它可以說多少種語言?

xAI 支援二十種由 BCP-47 代碼選定的語言,並提供自動語言偵測作為替代方案。每個內建聲音皆能說所有支援的語言,因此切換語言時無需更換聲音。

我可以在文字尚未傳輸完畢時串流音訊嗎?

可以。WebSocket 端點會在文字傳送時即時產生音訊,這在另一個模型仍在撰寫即將朗讀的回覆時特別有用。

我可以修正發音錯誤的單字嗎?

可以。發音替換功能讓您能將書面術語對應至其正確讀音,確保品牌名稱與縮寫詞在不編輯顯示文字的情況下也能正確發音。

Grok Voice TTS 的費用是多少?

在 TokenLab 上,Grok Voice TTS 價格為 輸入 $15.00 / 輸出 $0.00 每百萬字元。完整明細見上方價格表。

Grok Voice TTS 應該使用哪一個端點?

請使用 https://api.tokenlab.sh/v1/audio/speech 進行 Grok Voice TTS 的呼叫。下方的請求範例展示了對應的程式碼格式。

Grok Voice TTS 支援哪些操作?

Grok Voice TTS 支援 文字轉語音。請在上方選擇一項操作以查看其端點與請求範例。

比較 Grok Voice TTS

來源

更新於 2026年10月2日

更多來自 Grok Voice 的模型

相關模型