為每個請求選擇 Auto、TokenLab Verified 或 Official,並預先顯示價格。查看最新動態

Alibaba: Qwen3-TTS 1.7B VoiceDesign

Qwen3-TTS 1.7B VoiceDesign 是來自阿里巴巴的文字轉語音模型,可根據指定情緒、語氣與韻律的自然語言描述來建立自訂語音。它支援從 3 秒音訊樣本進行語音複製,生成包括中文、英文、日文、韓文與歐洲語言在內 10 種以上語言的語音,並達到低至 97ms 的延遲。
比較模型
qwen3-tts-1-7b-voicedesign
可用Alibaba文字轉語音同步
價格
起 $0.000015
模態
音訊

關於 Qwen3-TTS 1.7B VoiceDesign

Qwen3-TTS 1.7B VoiceDesign 是阿里巴巴的文字轉語音變體,它根據書面描述而非預設列表來創造語音。您以自然語言描述情感、語氣和韻律,模型便會以該語音朗讀文字。它涵蓋十種語言,適用於現有說話者無法符合您心中角色或品牌需求的情況。

適用場景

  • 語音由描述定義(例如:一位語速緩慢、溫暖的老年旁白),而非從固定列表中選擇。
  • 音色、情感和韻律皆可透過指令引導,包括強烈的情緒如憤怒。
  • 涵蓋十種語言:中文、英文、日文、韓文、德文、法文、俄文、葡萄牙文、西班牙文和義大利文,以及方言變體。
  • 阿里巴巴列出 Qwen3-TTS 系列的合成延遲約為 97 毫秒,適合互動使用。

其他選擇建議

  • 相同的描述在不同次呼叫中可能會產生略有差異的語音,因此若需在數月內重複使用完全相同的語音,此選項較不理想。
  • 如果您需要固定的具名說話者,擁有九種預設的 CustomVoice 變體更具可預測性。
  • 品質取決於您描述語音的清晰度;模糊的描述會產生通用的結果。

入門指南

  1. 建立 API 金鑰

    請至 Console 建立金鑰,即可在平台上使用各類模型。

  2. 發送您的第一個請求

    複製您所選語言的範例,並針對端點執行它。

    文字轉語音TokenLab 端點
    POST/v1/audio/speech
    curl -X POST "https://api.tokenlab.sh/v1/audio/speech" \
      -H "Authorization: Bearer sk-xxx" \
      -H "Content-Type: application/json" \
      -d '{
      "operation": "tts",
      "model": "qwen3-tts-1-7b-voicedesign",
      "input": "Hello from TokenLab.",
      "voice": "alloy"
    }'

定價

Official 價格為模型開發商的公開基準價。TokenLab 價格則為您在 TokenLab 使用該模型的實際費用。

文字轉語音

每百萬字元
Official 定價
$0.000015
Official
$0.000015
折扣
—

使用量與活動

成功率是請求完成的比例;延遲是一次完整回應所需的時間,P95 表示 95% 的請求在該時間內完成。

用量與可用性

過去 24 小時
請求數
成功率
P95 延遲
總 Token 用量
模型效能
當達到隱私權與資料量的門檻後,指標才會顯示。

資料基於彙總的使用者請求,不包含狀態檢查。

直接在 Console 裡試

在 Console 中開啟 Qwen3-TTS 1.7B VoiceDesign,並準備好編輯或發送提示詞。

協助我使用 qwen3-tts-1-7b-voicedesign 透過 /v1/audio/speech 進行音訊請求,並顯示結果與成本。

應用情境

  • 遊戲角色語音

    描述每個角色,例如「粗魯的矮人鐵匠」或「緊張的年輕信差」,無需先聘請配音員即可生成台詞。

  • 品牌語音探索

    嘗試多種公司語音描述,例如「自信且低沉」對比「明亮且快速」,並在同一腳本上進行比較。

  • 富有表現力的旁白

    在同一個專案中,透過「低沉且緊張」到「釋然且溫暖」等指令,指導故事章節的語氣呈現。

  • 影片語音原型

    在最終配音選定前,為分鏡腳本或說明影片建立臨時旁白。

提示詞範例

語音:一位中年女性,冷靜且低沉,像紀錄片旁白一樣緩慢說話。文字:The river has changed course three times in the last century.

語音:一位年輕男性,興奮且略帶喘息,語速快。文字:You will not believe what just came through the door.

語音:用特別憤怒的語氣說,快速且短促。文字:這已經是第三次了,你們到底有沒有在聽?

FAQ

Qwen3-TTS VoiceDesign 的用途是什麼?

它能生成您以文字指定的語音。您無需選擇具名說話者,而是撰寫包含情感、語氣和表達方式的描述,模型會產生符合該描述的音訊。它適合不符合現有預設語音的角色和品牌聲音。

它與 CustomVoice 有何不同?

CustomVoice 提供九種固定的具名說話者,並可選配風格指令。VoiceDesign 沒有固定列表,而是根據您的描述構建語音。選擇 VoiceDesign 以創造新語音,選擇 CustomVoice 以獲得穩定、可重複的說話者。

支援哪些語言?

十種:中文、英文、日文、韓文、德文、法文、俄文、葡萄牙文、西班牙文和義大利文,以及一些方言變體。請使用模型能理解的語言撰寫語音描述;模型卡上的範例使用的是中文。

我可以用它複製真實人物的聲音嗎?

Qwen3-TTS 系列描述了從短樣本進行語音複製的功能,但此變體本身的重點在於基於指令的設計。請僅複製或模仿您已獲得授權的語音,並根據您自己的同意規則檢查輸出內容。

每次呼叫的語音會完全相同嗎?

無法保證。描述可以引導語音,但無法鎖定完全相同的音色,因此重複呼叫可能會聽起來略有不同。如果您需要在長專案中精確重複,請使用固定的預設說話者。

Qwen3-TTS 1.7B VoiceDesign 的費用是多少?

在 TokenLab 上,Qwen3-TTS 1.7B VoiceDesign 價格為 - 。完整明細見上方價格表。 價格因計費單位、規格和用量而異。請在模型的詳細定價中比較相同條件下的費率;單一費率不代表總價。

Qwen3-TTS 1.7B VoiceDesign 應該使用哪一個端點?

請使用 https://api.tokenlab.sh/v1/audio/speech 進行 Qwen3-TTS 1.7B VoiceDesign 的呼叫。下方的請求範例展示了對應的程式碼格式。

Qwen3-TTS 1.7B VoiceDesign 支援哪些操作?

Qwen3-TTS 1.7B VoiceDesign 支援 文字轉語音。請在上方選擇一項操作以查看其端點與請求範例。

比較 Qwen3-TTS 1.7B VoiceDesign

來源

更新於 2026年10月2日

更多來自 Qwen TTS 的模型

相關模型