Alibaba: Qwen3-TTS 1.7B VoiceDesign
qwen3-tts-1-7b-voicedesign- 價格
- 起 $0.000015
- 模態
- 音訊
關於 Qwen3-TTS 1.7B VoiceDesign
Qwen3-TTS 1.7B VoiceDesign 是阿里巴巴的文字轉語音變體,它根據書面描述而非預設列表來創造語音。您以自然語言描述情感、語氣和韻律,模型便會以該語音朗讀文字。它涵蓋十種語言,適用於現有說話者無法符合您心中角色或品牌需求的情況。
適用場景
- 語音由描述定義(例如:一位語速緩慢、溫暖的老年旁白),而非從固定列表中選擇。
- 音色、情感和韻律皆可透過指令引導,包括強烈的情緒如憤怒。
- 涵蓋十種語言:中文、英文、日文、韓文、德文、法文、俄文、葡萄牙文、西班牙文和義大利文,以及方言變體。
- 阿里巴巴列出 Qwen3-TTS 系列的合成延遲約為 97 毫秒,適合互動使用。
其他選擇建議
- 相同的描述在不同次呼叫中可能會產生略有差異的語音,因此若需在數月內重複使用完全相同的語音,此選項較不理想。
- 如果您需要固定的具名說話者,擁有九種預設的 CustomVoice 變體更具可預測性。
- 品質取決於您描述語音的清晰度;模糊的描述會產生通用的結果。
入門指南
建立 API 金鑰
請至 Console 建立金鑰,即可在平台上使用各類模型。
發送您的第一個請求
複製您所選語言的範例,並針對端點執行它。
文字轉語音TokenLab 端點POST/v1/audio/speechcurl -X POST "https://api.tokenlab.sh/v1/audio/speech" \ -H "Authorization: Bearer sk-xxx" \ -H "Content-Type: application/json" \ -d '{ "operation": "tts", "model": "qwen3-tts-1-7b-voicedesign", "input": "Hello from TokenLab.", "voice": "alloy" }'
定價
Official 價格為模型開發商的公開基準價。TokenLab 價格則為您在 TokenLab 使用該模型的實際費用。
文字轉語音
每百萬字元- Official 定價
- $0.000015
- Official
- $0.000015
- 折扣
- —
| Official 定價每百萬字元 | Official每百萬字元 | 折扣 | |
|---|---|---|---|
| 文字轉語音 | $0.000015 | $0.000015 | — |
使用量與活動
成功率是請求完成的比例;延遲是一次完整回應所需的時間,P95 表示 95% 的請求在該時間內完成。
用量與可用性
過去 24 小時- 請求數
- 成功率
- P95 延遲
- 總 Token 用量
資料基於彙總的使用者請求,不包含狀態檢查。
直接在 Console 裡試
在 Console 中開啟 Qwen3-TTS 1.7B VoiceDesign,並準備好編輯或發送提示詞。
協助我使用 qwen3-tts-1-7b-voicedesign 透過 /v1/audio/speech 進行音訊請求,並顯示結果與成本。
應用情境
遊戲角色語音
描述每個角色,例如「粗魯的矮人鐵匠」或「緊張的年輕信差」,無需先聘請配音員即可生成台詞。
品牌語音探索
嘗試多種公司語音描述,例如「自信且低沉」對比「明亮且快速」,並在同一腳本上進行比較。
富有表現力的旁白
在同一個專案中,透過「低沉且緊張」到「釋然且溫暖」等指令,指導故事章節的語氣呈現。
影片語音原型
在最終配音選定前,為分鏡腳本或說明影片建立臨時旁白。
提示詞範例
語音:一位中年女性,冷靜且低沉,像紀錄片旁白一樣緩慢說話。文字:The river has changed course three times in the last century.
語音:一位年輕男性,興奮且略帶喘息,語速快。文字:You will not believe what just came through the door.
語音:用特別憤怒的語氣說,快速且短促。文字:這已經是第三次了,你們到底有沒有在聽?
FAQ
Qwen3-TTS VoiceDesign 的用途是什麼?
它能生成您以文字指定的語音。您無需選擇具名說話者,而是撰寫包含情感、語氣和表達方式的描述,模型會產生符合該描述的音訊。它適合不符合現有預設語音的角色和品牌聲音。
它與 CustomVoice 有何不同?
CustomVoice 提供九種固定的具名說話者,並可選配風格指令。VoiceDesign 沒有固定列表,而是根據您的描述構建語音。選擇 VoiceDesign 以創造新語音,選擇 CustomVoice 以獲得穩定、可重複的說話者。
支援哪些語言?
十種:中文、英文、日文、韓文、德文、法文、俄文、葡萄牙文、西班牙文和義大利文,以及一些方言變體。請使用模型能理解的語言撰寫語音描述;模型卡上的範例使用的是中文。
我可以用它複製真實人物的聲音嗎?
Qwen3-TTS 系列描述了從短樣本進行語音複製的功能,但此變體本身的重點在於基於指令的設計。請僅複製或模仿您已獲得授權的語音,並根據您自己的同意規則檢查輸出內容。
每次呼叫的語音會完全相同嗎?
無法保證。描述可以引導語音,但無法鎖定完全相同的音色,因此重複呼叫可能會聽起來略有不同。如果您需要在長專案中精確重複,請使用固定的預設說話者。
Qwen3-TTS 1.7B VoiceDesign 的費用是多少?
在 TokenLab 上,Qwen3-TTS 1.7B VoiceDesign 價格為 - 。完整明細見上方價格表。 價格因計費單位、規格和用量而異。請在模型的詳細定價中比較相同條件下的費率;單一費率不代表總價。
Qwen3-TTS 1.7B VoiceDesign 應該使用哪一個端點?
請使用 https://api.tokenlab.sh/v1/audio/speech 進行 Qwen3-TTS 1.7B VoiceDesign 的呼叫。下方的請求範例展示了對應的程式碼格式。
Qwen3-TTS 1.7B VoiceDesign 支援哪些操作?
Qwen3-TTS 1.7B VoiceDesign 支援 文字轉語音。請在上方選擇一項操作以查看其端點與請求範例。
比較 Qwen3-TTS 1.7B VoiceDesign
來源
更新於 2026年10月2日