Alibaba: CosyVoice v3.5 Plus
cosyvoice-v3.5-plus- 入力 / 出力
- $22.06 / $0.00
- モダリティ
- オーディオ
CosyVoice v3.5 Plus について
CosyVoice v3.5 Plusは、ユーザー自身が作成した音声のためのAlibabaの音声合成モデルです。標準の音声リストはなく、サンプルから音声をクローンするか、テキストによる説明から音声を設計し、WebSocket接続を通じて合成します。北京語、英語、その他いくつかの言語に加え、多くの中国語の方言に対応しており、Qwen3-TTS-Flashにはない、自然言語による指示で話し方を制御する機能があります。
得意なこと
- 録音データからクローンした音声、またはテキストによる説明から設計した音声で動作します。
- トーンや話し方を制御するための指示を受け付けます。
- 北京語、広東語、多くの中国語の方言に加え、英語、フランス語、ドイツ語、日本語、韓国語、ロシア語、ポルトガル語、タイ語、インドネシア語、ベトナム語を話します。
- WebSocket経由で音声をストリーミングするため、合成の完了を待たずに再生を開始できます。
他のモデルを検討すべきケース
- 組み込みのシステム音声はありません。最初にクローンまたは設計された音声を作成する必要があります。
- 単純なHTTPリクエストではなく、WebSocketクライアントが必要です。
- 音声クローンには、クリアな参照サンプルと、その音声を使用する同意が必要です。
はじめに
最初のキーを作成
Consoleでキーを作成すれば、プラットフォーム内のすべてのモデルで使えます。
最初のリクエストを送信する
お使いの言語の例をコピーして、エンドポイントに対して実行してください。
テキスト読み上げTokenLab エンドポイントPOST/v1/audio/speechcurl -X POST "https://api.tokenlab.sh/v1/audio/speech" \ -H "Authorization: Bearer sk-xxx" \ -H "Content-Type: application/json" \ -d '{ "operation": "tts", "response_format": "mp3", "speed": 1, "model": "cosyvoice-v3.5-plus", "input": "Hello from TokenLab.", "voice": "alloy" }'
料金
Official価格はモデル提供者の公開基準です。TokenLab価格はTokenLabでのご利用料金です。
Cosy Tts Number
100万文字あたり- 公式価格
- 入力 $22.06 / 出力 $0.00
- Official
- 入力 $22.06 / 出力 $0.00
- 割引
- —
| 公式価格100万文字あたり | Official100万文字あたり | 割引 | |
|---|---|---|---|
| Cosy Tts Number | 入力 $22.06 / 出力 $0.00 | 入力 $22.06 / 出力 $0.00 | — |
使用状況とアクティビティ
成功率は完了したリクエストの割合です。レイテンシは完全なレスポンスにかかる時間で、P95 は 95% のリクエストがその時間内に完了したことを意味します。
使用量と可用性
過去24時間- リクエスト数
- 成功率
- P95 レイテンシ
- 合計トークン数
データはステータスチェックを除外した、集計済みのユーザーリクエストに基づいています。
Consoleで開く
ConsoleでCosyVoice v3.5 Plusを開き、プロンプトを編集・送信できます。
cosyvoice-v3.5-plusと/v1/audio/speechで音声をテスト。結果とコストを表示します。
ユースケース
ブランド音声
承認された話者の音声を一度クローンし、製品ツアー、IVRプロンプト、アナウンスにその音声を使用します。
キャラクター音声
オーディオブックやゲーム向けに、「温かみのある年配の語り手」といった説明から音声を設計します。
地域方言のナレーション
四川語、上海語、広東語などで、地域の視聴者に向けた音声コンテンツを作成します。
プロンプト例
このアナウンスを、きびきびとした明るいトーンで、日付の後に短い間を置いて読んでください。
以下の段落を、まるでベッドタイムストーリーを読み聞かせるように、ゆっくりと温かみのある声で話してください。
これを広東語で、リラックスした会話調のペースで話してください。
FAQ
CosyVoice v3.5 Plusにはプリセット音声がありますか?
いいえ。Alibabaはこのモデルに対してシステム音声を提供していません。サンプルからクローンした音声か、テキストの説明から設計した音声が必要であり、合成時にその音声を指定する必要があります。
どの言語や方言に対応していますか?
北京語、広東語、多くの中国語の方言に加え、英語、フランス語、ドイツ語、日本語、韓国語、ロシア語、ポルトガル語、タイ語、インドネシア語、ベトナム語に対応しています。方言への対応は、Qwen3-TTS-Flashモデルとの主な違いです。
音声を制御できますか?
はい。このモデルは指示による制御をサポートしているため、トーン、感情、ペースを自然言語で記述できます。音声の選択によって「誰が話すか」が決まり、指示によって「どのように話すか」が形作られます。
どのように呼び出しますか?
生成された音声をストリーミングで返すWebSocket APIを通じて呼び出します。これは長いスクリプトやライブ再生に適していますが、接続を処理するクライアントが必要です。
いつQwen3-TTS-Flashを選択すべきですか?
すぐに使える音声と単純なHTTP呼び出しを求めており、クローンや指示による制御が不要な場合です。音声のアイデンティティや話し方が製品の一部となる場合は、CosyVoiceを選択してください。
CosyVoice v3.5 Plus の料金はいくらですか?
TokenLab では CosyVoice v3.5 Plus は 入力 $22.06 / 出力 $0.00 100万文字あたり です。詳細は上の料金表を参照してください。 料金は課金単位・仕様・使用量によって異なります。モデルの詳細な料金で同条件同士を比較してください。単一のレートで総額は決まりません。
CosyVoice v3.5 Plus はどのエンドポイントを使うべきですか?
CosyVoice v3.5 Plus のデフォルトは https://api.tokenlab.sh/v1/audio/speech です。プロバイダーネイティブ形式に対応している場合は、API workbench にそのエンドポイントも表示されます。
CosyVoice v3.5 Plus はどの操作に対応していますか?
CosyVoice v3.5 Plus は テキスト読み上げ に対応しています。上の API workbench で操作を選ぶと、対応するエンドポイントとコード例が表示されます。
CosyVoice v3.5 Plus を比較する
ソース
2026/10/02 時点での評価