各リクエストに対して Auto、TokenLab Verified、または Official を選択でき、価格は事前に表示されます。新機能を見る

Alibaba: CosyVoice v3.5 Plus

CosyVoice v3.5 Plusは、書かれたスクリプトを表現力豊かな音声に変換します。ナレーション付き記事、会話形式のボイスオーバー、音声による製品ガイダンスなどに使用でき、聴衆に合わせて声質や話速を選択可能です。
モデルを比較
cosyvoice-v3.5-plus
利用可能Alibabaテキスト読み上げ同期
入力 / 出力
$22.06 / $0.00
モダリティ
オーディオ

CosyVoice v3.5 Plus について

CosyVoice v3.5 Plusは、ユーザー自身が作成した音声のためのAlibabaの音声合成モデルです。標準の音声リストはなく、サンプルから音声をクローンするか、テキストによる説明から音声を設計し、WebSocket接続を通じて合成します。北京語、英語、その他いくつかの言語に加え、多くの中国語の方言に対応しており、Qwen3-TTS-Flashにはない、自然言語による指示で話し方を制御する機能があります。

得意なこと

  • 録音データからクローンした音声、またはテキストによる説明から設計した音声で動作します。
  • トーンや話し方を制御するための指示を受け付けます。
  • 北京語、広東語、多くの中国語の方言に加え、英語、フランス語、ドイツ語、日本語、韓国語、ロシア語、ポルトガル語、タイ語、インドネシア語、ベトナム語を話します。
  • WebSocket経由で音声をストリーミングするため、合成の完了を待たずに再生を開始できます。

他のモデルを検討すべきケース

  • 組み込みのシステム音声はありません。最初にクローンまたは設計された音声を作成する必要があります。
  • 単純なHTTPリクエストではなく、WebSocketクライアントが必要です。
  • 音声クローンには、クリアな参照サンプルと、その音声を使用する同意が必要です。

はじめに

  1. 最初のキーを作成

    Consoleでキーを作成すれば、プラットフォーム内のすべてのモデルで使えます。

  2. 最初のリクエストを送信する

    お使いの言語の例をコピーして、エンドポイントに対して実行してください。

    テキスト読み上げTokenLab エンドポイント
    POST/v1/audio/speech
    curl -X POST "https://api.tokenlab.sh/v1/audio/speech" \
      -H "Authorization: Bearer sk-xxx" \
      -H "Content-Type: application/json" \
      -d '{
      "operation": "tts",
      "response_format": "mp3",
      "speed": 1,
      "model": "cosyvoice-v3.5-plus",
      "input": "Hello from TokenLab.",
      "voice": "alloy"
    }'

料金

Official価格はモデル提供者の公開基準です。TokenLab価格はTokenLabでのご利用料金です。

Cosy Tts Number

100万文字あたり
公式価格
入力 $22.06 / 出力 $0.00
Official
入力 $22.06 / 出力 $0.00
割引
—

使用状況とアクティビティ

成功率は完了したリクエストの割合です。レイテンシは完全なレスポンスにかかる時間で、P95 は 95% のリクエストがその時間内に完了したことを意味します。

使用量と可用性

過去24時間
リクエスト数
成功率
P95 レイテンシ
合計トークン数
モデルパフォーマンス
プライバシーおよびデータ量のしきい値に達すると、メトリクスが表示されます。

データはステータスチェックを除外した、集計済みのユーザーリクエストに基づいています。

Consoleで開く

ConsoleでCosyVoice v3.5 Plusを開き、プロンプトを編集・送信できます。

cosyvoice-v3.5-plusと/v1/audio/speechで音声をテスト。結果とコストを表示します。

ユースケース

  • ブランド音声

    承認された話者の音声を一度クローンし、製品ツアー、IVRプロンプト、アナウンスにその音声を使用します。

  • キャラクター音声

    オーディオブックやゲーム向けに、「温かみのある年配の語り手」といった説明から音声を設計します。

  • 地域方言のナレーション

    四川語、上海語、広東語などで、地域の視聴者に向けた音声コンテンツを作成します。

プロンプト例

このアナウンスを、きびきびとした明るいトーンで、日付の後に短い間を置いて読んでください。

以下の段落を、まるでベッドタイムストーリーを読み聞かせるように、ゆっくりと温かみのある声で話してください。

これを広東語で、リラックスした会話調のペースで話してください。

FAQ

CosyVoice v3.5 Plusにはプリセット音声がありますか?

いいえ。Alibabaはこのモデルに対してシステム音声を提供していません。サンプルからクローンした音声か、テキストの説明から設計した音声が必要であり、合成時にその音声を指定する必要があります。

どの言語や方言に対応していますか?

北京語、広東語、多くの中国語の方言に加え、英語、フランス語、ドイツ語、日本語、韓国語、ロシア語、ポルトガル語、タイ語、インドネシア語、ベトナム語に対応しています。方言への対応は、Qwen3-TTS-Flashモデルとの主な違いです。

音声を制御できますか?

はい。このモデルは指示による制御をサポートしているため、トーン、感情、ペースを自然言語で記述できます。音声の選択によって「誰が話すか」が決まり、指示によって「どのように話すか」が形作られます。

どのように呼び出しますか?

生成された音声をストリーミングで返すWebSocket APIを通じて呼び出します。これは長いスクリプトやライブ再生に適していますが、接続を処理するクライアントが必要です。

いつQwen3-TTS-Flashを選択すべきですか?

すぐに使える音声と単純なHTTP呼び出しを求めており、クローンや指示による制御が不要な場合です。音声のアイデンティティや話し方が製品の一部となる場合は、CosyVoiceを選択してください。

CosyVoice v3.5 Plus の料金はいくらですか?

TokenLab では CosyVoice v3.5 Plus は 入力 $22.06 / 出力 $0.00 100万文字あたり です。詳細は上の料金表を参照してください。 料金は課金単位・仕様・使用量によって異なります。モデルの詳細な料金で同条件同士を比較してください。単一のレートで総額は決まりません。

CosyVoice v3.5 Plus はどのエンドポイントを使うべきですか?

CosyVoice v3.5 Plus のデフォルトは https://api.tokenlab.sh/v1/audio/speech です。プロバイダーネイティブ形式に対応している場合は、API workbench にそのエンドポイントも表示されます。

CosyVoice v3.5 Plus はどの操作に対応していますか?

CosyVoice v3.5 Plus は テキスト読み上げ に対応しています。上の API workbench で操作を選ぶと、対応するエンドポイントとコード例が表示されます。

CosyVoice v3.5 Plus を比較する

ソース

2026/10/02 時点での評価

関連モデル