為每個請求選擇 Auto、TokenLab Verified 或 Official,並預先顯示價格。查看最新動態

Alibaba: Qwen3-TTS 1.7B CustomVoice

Qwen3-TTS 1.7B CustomVoice 是來自阿里巴巴的文字轉語音模型,提供九種涵蓋不同性別、年齡、語言與方言組合的優質預設音色。它透過使用者指令對目標語音提供精確的風格控制,支援從 3 秒樣本進行語音複製,並能以低至 97ms 的延遲生成 10 種以上語言的語音。
比較模型
qwen3-tts-1-7b-customvoice
可用Alibaba文字轉語音同步
價格
起 $0.000015
模態
音訊

關於 Qwen3-TTS 1.7B CustomVoice

Qwen3-TTS 1.7B CustomVoice 是阿里巴巴的文字轉語音模型,圍繞九種預設語音構建。您可以按名稱選擇說話者,並添加關於語氣、情感或說話風格的自然語言指令。它支援十種語言,包括中文、英文、日文、韓文以及多種歐洲語言。阿里巴巴稱其端到端合成延遲最低可達 97 毫秒,適用於互動場景。

適用場景

  • 九位具名的優質說話者涵蓋了不同的性別、年齡、語言和方言,確保語音在整個產品中保持一致。
  • 書面指令可以在不更換所選說話者的情況下,引導情感和說話方式。
  • 支援十種語言:中文、英文、日文、韓文、德文、法文、俄文、葡萄牙文、西班牙文和義大利文。
  • 阿里巴巴報告稱端到端延遲最低可達 97 毫秒,適合語音助理和即時旁白。

其他選擇建議

  • 語音列表是固定的;若要根據描述創造新語音,VoiceDesign 變體更為合適。
  • 當說話者閱讀其母語時效果最佳,因此使用英文預設閱讀日文可能會帶有口音。
  • 嘈雜或異常的輸入文字(例如大量的標記或混合符號)可能會降低輸出品質。

入門指南

  1. 建立 API 金鑰

    請至 Console 建立金鑰,即可在平台上使用各類模型。

  2. 發送您的第一個請求

    複製您所選語言的範例,並針對端點執行它。

    文字轉語音TokenLab 端點
    POST/v1/audio/speech
    curl -X POST "https://api.tokenlab.sh/v1/audio/speech" \
      -H "Authorization: Bearer sk-xxx" \
      -H "Content-Type: application/json" \
      -d '{
      "operation": "tts",
      "model": "qwen3-tts-1-7b-customvoice",
      "input": "Hello from TokenLab.",
      "voice": "alloy"
    }'

定價

Official 價格為模型開發商的公開基準價。TokenLab 價格則為您在 TokenLab 使用該模型的實際費用。

文字轉語音

每百萬字元
Official 定價
$0.000015
Official
$0.000015
折扣
—

使用量與活動

成功率是請求完成的比例;延遲是一次完整回應所需的時間,P95 表示 95% 的請求在該時間內完成。

用量與可用性

過去 24 小時
請求數
成功率
P95 延遲
總 Token 用量
模型效能
當達到隱私權與資料量的門檻後,指標才會顯示。

資料基於彙總的使用者請求,不包含狀態檢查。

直接在 Console 裡試

在 Console 中開啟 Qwen3-TTS 1.7B CustomVoice,並準備好編輯或發送提示詞。

協助我使用 qwen3-tts-1-7b-customvoice 透過 /v1/audio/speech 進行音訊請求,並顯示結果與成本。

應用情境

  • 語音助理

    為應用程式內助理提供一個穩定的具名語音和低回應延遲,確保文字準備就緒後能迅速開始播放回覆。

  • 有聲書與文章旁白

    使用選定的說話者朗讀長文本,並添加如「冷靜且溫暖」的指令,以保持各章節間的語氣一致。

  • 在地化產品影片

    使用日文、韓文或英文預設為不同市場配音,同時保持品牌聲音的可辨識度。

  • 遊戲與角色台詞

    為不同角色選擇獨特的預設語音,並添加如「憤怒」、「疲憊」或「興奮」的情感指令。

提示詞範例

說話者:Ryan。指令:冷靜、友善、語速稍慢。文字:Welcome back. Your order has shipped and should arrive on Thursday.

說話者:Ono_Anna。指令:開朗的播音員。文字:本日はご来店いただき、ありがとうございます。

說話者:Vivian。指令:耳語,像在說秘密。文字:你听说了吗?明天会有一个大消息。

FAQ

Qwen3-TTS CustomVoice 提供哪些語音?

九種預設:Vivian、Serena、Uncle_Fu、Dylan 和 Eric(中文變體),Ryan 和 Aiden(英文),Ono_Anna(日文),以及 Sohee(韓文)。每個請求需按名稱選擇其中一個。

我可以控制情感和說話風格嗎?

可以。您可以添加自然語言指令,例如「憤怒」、「溫柔」或「快速且興奮」,模型會在保持所選說話者音色的同時調整語氣和方式。

CustomVoice 與 VoiceDesign 有何不同?

CustomVoice 使用您選擇的九種固定說話者。VoiceDesign 沒有預設列表;您透過文字描述想要的語音(如年齡、情緒和韻律),模型會隨之生成。若追求一致性請選擇 CustomVoice,若需要新語音則選擇 VoiceDesign。

它支援哪些語言?

十種:中文、英文、日文、韓文、德文、法文、俄文、葡萄牙文、西班牙文和義大利文。模型卡建議使用每位說話者的母語以獲得最佳品質。

它的速度足以進行即時對話嗎?

阿里巴巴稱端到端合成延遲最低可達 97 毫秒,旨在實現即時使用。應用程式中的實際延遲還取決於網路距離和文字長度,請使用您自己的流量進行測量。

Qwen3-TTS 1.7B CustomVoice 的費用是多少?

在 TokenLab 上,Qwen3-TTS 1.7B CustomVoice 價格為 - 。完整明細見上方價格表。 價格因計費單位、規格和用量而異。請在模型的詳細定價中比較相同條件下的費率;單一費率不代表總價。

Qwen3-TTS 1.7B CustomVoice 應該使用哪一個端點?

請使用 https://api.tokenlab.sh/v1/audio/speech 進行 Qwen3-TTS 1.7B CustomVoice 的呼叫。下方的請求範例展示了對應的程式碼格式。

Qwen3-TTS 1.7B CustomVoice 支援哪些操作?

Qwen3-TTS 1.7B CustomVoice 支援 文字轉語音。請在上方選擇一項操作以查看其端點與請求範例。

比較 Qwen3-TTS 1.7B CustomVoice

來源

更新於 2026年10月2日

更多來自 Qwen TTS 的模型

相關模型