為每個請求選擇 Auto、TokenLab Verified 或 Official,並預先顯示價格。查看最新動態

Alibaba: CosyVoice v3.5 Plus

CosyVoice v3.5 Plus 可將書面腳本轉換為富有表現力的語音。適用於文章旁白、對話式配音及口語化產品指引,並可根據受眾選擇語音與語速。
比較模型
cosyvoice-v3.5-plus
可用Alibaba文字轉語音同步
輸入 / 輸出
$22.06 / $0.00
模態
音訊

關於 CosyVoice v3.5 Plus

CosyVoice v3.5 Plus 是阿里巴巴推出的語音合成模型,專為您自行建立的語音而設計。它沒有內建的現成語音清單:您可以從樣本複製語音,或透過文字描述設計語音,然後透過 WebSocket 連線進行合成。它支援普通話、英語及多種其他語言,並包含許多中國方言。此外,它能接收自然語言指令來引導語音表達方式,這是 Qwen3-TTS-Flash 所不具備的功能。

適用場景

  • 適用於從錄音複製的語音,或從文字描述設計出的語音。
  • 接受指令以控制語氣與說話風格。
  • 支援普通話、粵語及許多中國方言,以及英語、法語、德語、日語、韓語、俄語、葡萄牙語、泰語、印尼語和越南語。
  • 透過 WebSocket 串流音訊,因此在合成完成前即可開始播放。

其他選擇建議

  • 它沒有內建的系統語音;您必須先建立複製語音或設計語音。
  • 它需要 WebSocket 用戶端,而非簡單的 HTTP 請求。
  • 語音複製需要清晰的參考樣本,並需取得使用該語音的授權。

入門指南

  1. 建立 API 金鑰

    請至 Console 建立金鑰,即可在平台上使用各類模型。

  2. 發送您的第一個請求

    複製您所選語言的範例,並針對端點執行它。

    文字轉語音TokenLab 端點
    POST/v1/audio/speech
    curl -X POST "https://api.tokenlab.sh/v1/audio/speech" \
      -H "Authorization: Bearer sk-xxx" \
      -H "Content-Type: application/json" \
      -d '{
      "operation": "tts",
      "response_format": "mp3",
      "speed": 1,
      "model": "cosyvoice-v3.5-plus",
      "input": "Hello from TokenLab.",
      "voice": "alloy"
    }'

定價

Official 價格為模型開發商的公開基準價。TokenLab 價格則為您在 TokenLab 使用該模型的實際費用。

Cosy Tts Number

每百萬字元
Official 定價
輸入 $22.06 / 輸出 $0.00
Official
輸入 $22.06 / 輸出 $0.00
折扣
—

使用量與活動

成功率是請求完成的比例;延遲是一次完整回應所需的時間,P95 表示 95% 的請求在該時間內完成。

用量與可用性

過去 24 小時
請求數
成功率
P95 延遲
總 Token 用量
模型效能
當達到隱私權與資料量的門檻後,指標才會顯示。

資料基於彙總的使用者請求,不包含狀態檢查。

直接在 Console 裡試

在 Console 中開啟 CosyVoice v3.5 Plus,並準備好編輯或發送提示詞。

協助我使用 cosyvoice-v3.5-plus 透過 /v1/audio/speech 進行音訊請求,並顯示結果與成本。

應用情境

  • 品牌語音

    複製一位經核准的說話者,並將該語音用於產品導覽、IVR 語音提示及公告。

  • 角色語音

    根據描述設計語音(例如溫暖的年長說書人),用於有聲書或遊戲。

  • 方言旁白

    為當地受眾製作四川話、上海話或粵語的語音內容。

提示詞範例

用輕快、積極的語氣朗讀此公告,並在日期後加入短暫停頓。

以緩慢且溫暖的方式朗讀以下段落,就像在講床邊故事一樣。

用粵語說這段話,語速要輕鬆且口語化。

FAQ

CosyVoice v3.5 Plus 有預設語音嗎?

沒有。阿里巴巴未針對此模型列出任何系統語音。您需要使用從樣本複製的語音或從文字描述設計的語音,並在合成時傳入該語音。

它支援哪些語言與方言?

支援普通話、粵語及許多中國方言,以及英語、法語、德語、日語、韓語、俄語、葡萄牙語、泰語、印尼語和越南語。方言支援是其與 Qwen3-TTS-Flash 模型的主要差異。

我可以控制它的聲音表現嗎?

可以。該模型支援指令控制,因此您可以用自然語言描述語氣、情緒或節奏。語音選擇決定了「誰」在說話;而指令則塑造了語句「如何」被表達。

如何呼叫此模型?

透過 WebSocket API,在生成音訊的同時進行串流回傳。這適用於長腳本與即時播放,但您需要一個能處理該連線的用戶端。

何時該選擇 Qwen3-TTS-Flash?

當您需要現成的語音、簡單的 HTTP 呼叫,且不需要語音複製或指令控制時。當語音識別度或表達風格是您產品的一部分時,請選擇 CosyVoice。

CosyVoice v3.5 Plus 的費用是多少?

在 TokenLab 上,CosyVoice v3.5 Plus 價格為 輸入 $22.06 / 輸出 $0.00 每百萬字元。完整明細見上方價格表。 價格因計費單位、規格和用量而異。請在模型的詳細定價中比較相同條件下的費率;單一費率不代表總價。

CosyVoice v3.5 Plus 應該使用哪一個端點?

請使用 https://api.tokenlab.sh/v1/audio/speech 進行 CosyVoice v3.5 Plus 的呼叫。下方的請求範例展示了對應的程式碼格式。

CosyVoice v3.5 Plus 支援哪些操作?

CosyVoice v3.5 Plus 支援 文字轉語音。請在上方選擇一項操作以查看其端點與請求範例。

比較 CosyVoice v3.5 Plus

來源

更新於 2026年10月2日

相關模型