各リクエストに対して Auto、TokenLab Verified、または Official を選択でき、価格は事前に表示されます。新機能を見る

Alibaba: Qwen3-TTS 1.7B CustomVoice

Qwen3-TTS 1.7B CustomVoiceは、性別、年齢、言語、方言の様々な組み合わせにわたる9つのプレミアムなプリセット音色を提供するAlibabaのテキスト・トゥ・スピーチ(音声合成)モデルです。ユーザーの指示を通じてターゲット音声のスタイルを正確に制御でき、3秒のサンプルからの音声クローン作成をサポートし、10以上の言語で97msという低レイテンシで音声を生成します。
モデルを比較
qwen3-tts-1-7b-customvoice
利用可能Alibabaテキスト読み上げ同期
価格
価格 $0.000015
モダリティ
オーディオ

Qwen3-TTS 1.7B CustomVoice について

Qwen3-TTS 1.7B CustomVoiceは、9種類の固定されたプリセット音声で構成されるAlibabaのテキスト読み上げ(TTS)モデルです。話者を名前で選択し、トーン、感情、話し方に関する自然言語の指示を追加できます。中国語、英語、日本語、韓国語、および複数のヨーロッパ言語を含む10言語に対応しており、Alibabaは対話型用途向けのエンドツーエンドの合成レイテンシを最短97msと公表しています。

得意なこと

  • 性別、年齢、言語、方言が異なる9名のプレミアムな話者が用意されており、製品全体を通して一貫した音声を使用できます。
  • テキストによる指示を与えることで、選択した話者を変更することなく、感情や話し方を調整できます。
  • 対応言語は、中国語、英語、日本語、韓国語、ドイツ語、フランス語、ロシア語、ポルトガル語、スペイン語、イタリア語の10言語です。
  • Alibabaはエンドツーエンドのレイテンシを最短97msと報告しており、音声アシスタントやライブナレーションに適しています。

他のモデルを検討すべきケース

  • 音声リストは固定されています。説明文から新しい音声を生成したい場合は、VoiceDesignバリアントが適しています。
  • 話者が自身の母国語を読み上げる場合に最も良い結果が得られます。そのため、英語のプリセットで日本語を読み上げると、アクセントがつく可能性があります。
  • ノイズの多いテキストや、過度なマークアップ、記号が混在するテキストを入力すると、出力品質が低下する場合があります。

はじめに

  1. 最初のキーを作成

    Consoleでキーを作成すれば、プラットフォーム内のすべてのモデルで使えます。

  2. 最初のリクエストを送信する

    お使いの言語の例をコピーして、エンドポイントに対して実行してください。

    テキスト読み上げTokenLab エンドポイント
    POST/v1/audio/speech
    curl -X POST "https://api.tokenlab.sh/v1/audio/speech" \
      -H "Authorization: Bearer sk-xxx" \
      -H "Content-Type: application/json" \
      -d '{
      "operation": "tts",
      "model": "qwen3-tts-1-7b-customvoice",
      "input": "Hello from TokenLab.",
      "voice": "alloy"
    }'

料金

Official価格はモデル提供者の公開基準です。TokenLab価格はTokenLabでのご利用料金です。

テキスト読み上げ

100万文字あたり
公式価格
$0.000015
Official
$0.000015
割引
—

使用状況とアクティビティ

成功率は完了したリクエストの割合です。レイテンシは完全なレスポンスにかかる時間で、P95 は 95% のリクエストがその時間内に完了したことを意味します。

使用量と可用性

過去24時間
リクエスト数
成功率
P95 レイテンシ
合計トークン数
モデルパフォーマンス
プライバシーおよびデータ量のしきい値に達すると、メトリクスが表示されます。

データはステータスチェックを除外した、集計済みのユーザーリクエストに基づいています。

Consoleで開く

ConsoleでQwen3-TTS 1.7B CustomVoiceを開き、プロンプトを編集・送信できます。

qwen3-tts-1-7b-customvoiceと/v1/audio/speechで音声をテスト。結果とコストを表示します。

ユースケース

  • 音声アシスタント

    アプリ内のアシスタントに固定された名前付きの音声を割り当て、応答遅延を抑えることで、テキスト生成後すぐに再生を開始できます。

  • オーディオブックおよび記事のナレーション

    選択した話者で長文を読み上げ、「穏やかで温かい」といった指示を加えることで、章をまたいでも一貫した語り口を維持できます。

  • ローカライズされた製品動画

    日本語、韓国語、または英語のプリセットを使用して、ブランドの音声を維持したまま、市場ごとに同じスクリプトを読み上げることができます。

  • ゲームやキャラクターのセリフ

    キャラクターごとに異なるプリセットを選択し、怒り、疲れ、興奮などの感情指示を加えることができます。

プロンプト例

話者:Ryan。指示:穏やか、フレンドリー、少しゆっくり。テキスト:Welcome back. Your order has shipped and should arrive on Thursday.

話者:Ono_Anna。指示:明るいアナウンサー。テキスト:本日はご来店いただき、ありがとうございます。

話者:Vivian。指示:ささやき声、秘密を話すように。テキスト:你听说了吗?明天会有一个大消息。

FAQ

Qwen3-TTS CustomVoiceではどのような音声が提供されていますか?

9種類のプリセットがあります。中国語バリアントとしてVivian、Serena、Uncle_Fu、Dylan、Eric、英語としてRyan、Aiden、日本語としてOno_Anna、韓国語としてSoheeが用意されています。リクエストごとに名前で1つを選択します。

感情や話し方を制御できますか?

はい。怒り、穏やか、あるいは速く興奮した様子など、自然言語による指示を追加することで、選択した話者の音色を保ちつつ、トーンや話し方を調整できます。

CustomVoiceとVoiceDesignの違いは何ですか?

CustomVoiceは、選択可能な9種類の固定された話者を使用します。VoiceDesignにはプリセットリストがなく、年齢、気分、韻律などを言葉で説明して音声を生成します。一貫性を求めるならCustomVoice、新しい音声を生成したいならVoiceDesignを選択してください。

どの言語に対応していますか?

中国語、英語、日本語、韓国語、ドイツ語、フランス語、ロシア語、ポルトガル語、スペイン語、イタリア語の10言語です。モデルカードでは、最高の品質を得るために、各話者の母国語で使用することを推奨しています。

ライブ会話に十分な速さですか?

Alibabaは、リアルタイム用途を想定したエンドツーエンドの合成レイテンシを最短97msと公表しています。アプリでの実際の遅延はネットワーク距離やテキストの長さに依存するため、自身のトラフィックで測定してください。

Qwen3-TTS 1.7B CustomVoice の料金はいくらですか?

TokenLab では Qwen3-TTS 1.7B CustomVoice は - です。詳細は上の料金表を参照してください。 料金は課金単位・仕様・使用量によって異なります。モデルの詳細な料金で同条件同士を比較してください。単一のレートで総額は決まりません。

Qwen3-TTS 1.7B CustomVoice はどのエンドポイントを使うべきですか?

Qwen3-TTS 1.7B CustomVoice のデフォルトは https://api.tokenlab.sh/v1/audio/speech です。プロバイダーネイティブ形式に対応している場合は、API workbench にそのエンドポイントも表示されます。

Qwen3-TTS 1.7B CustomVoice はどの操作に対応していますか?

Qwen3-TTS 1.7B CustomVoice は テキスト読み上げ に対応しています。上の API workbench で操作を選ぶと、対応するエンドポイントとコード例が表示されます。

Qwen3-TTS 1.7B CustomVoice を比較する

ソース

2026/10/02 時点での評価

Qwen TTS の他のモデル

関連モデル