各リクエストに対して Auto、TokenLab Verified、または Official を選択でき、価格は事前に表示されます。新機能を見る

Alibaba: Qwen3-TTS 1.7B VoiceDesign

Qwen3-TTS 1.7B VoiceDesignは、感情、トーン、韻律を指定する自然言語の記述からカスタム音声を作成するAlibabaのテキスト・トゥ・スピーチモデルです。3秒の音声サンプルからの音声クローン作成をサポートし、中国語、英語、日本語、韓国語、欧州言語を含む10以上の言語で、97msという低レイテンシで音声を生成します。
モデルを比較
qwen3-tts-1-7b-voicedesign
利用可能Alibabaテキスト読み上げ同期
価格
価格 $0.000015
モダリティ
オーディオ

Qwen3-TTS 1.7B VoiceDesign について

Qwen3-TTS 1.7B VoiceDesignは、プリセットリストではなく、記述された説明文から音声を生成するAlibabaのテキスト読み上げバリアントです。感情、トーン、韻律を自然言語で記述すると、モデルはその音声でテキストを読み上げます。10言語に対応しており、既存の話者ではキャラクターやブランドのイメージに合わない場合に適しています。

得意なこと

  • 音声は固定リストから選択するのではなく、「ゆっくりとした温かい語り口の年配のナレーター」といった説明文によって定義されます。
  • 音色、感情、韻律はすべて指示によって制御可能で、怒りのような強い感情も表現できます。
  • 中国語、英語、日本語、韓国語、ドイツ語、フランス語、ロシア語、ポルトガル語、スペイン語、イタリア語の10言語と、その方言バリアントに対応しています。
  • AlibabaはQwen3-TTSファミリーの合成レイテンシを約97msと公表しており、対話型用途に適しています。

他のモデルを検討すべきケース

  • 同じ説明文でも呼び出しごとに音声がわずかに異なる場合があるため、数ヶ月にわたって全く同じ音声を繰り返す必要がある用途には不向きです。
  • 固定された名前付きの話者が必要な場合は、9種類のプリセットを持つCustomVoiceバリアントの方が予測可能です。
  • 品質は音声の説明の明確さに依存します。説明が曖昧だと、一般的な結果になります。

はじめに

  1. 最初のキーを作成

    Consoleでキーを作成すれば、プラットフォーム内のすべてのモデルで使えます。

  2. 最初のリクエストを送信する

    お使いの言語の例をコピーして、エンドポイントに対して実行してください。

    テキスト読み上げTokenLab エンドポイント
    POST/v1/audio/speech
    curl -X POST "https://api.tokenlab.sh/v1/audio/speech" \
      -H "Authorization: Bearer sk-xxx" \
      -H "Content-Type: application/json" \
      -d '{
      "operation": "tts",
      "model": "qwen3-tts-1-7b-voicedesign",
      "input": "Hello from TokenLab.",
      "voice": "alloy"
    }'

料金

Official価格はモデル提供者の公開基準です。TokenLab価格はTokenLabでのご利用料金です。

テキスト読み上げ

100万文字あたり
公式価格
$0.000015
Official
$0.000015
割引
—

使用状況とアクティビティ

成功率は完了したリクエストの割合です。レイテンシは完全なレスポンスにかかる時間で、P95 は 95% のリクエストがその時間内に完了したことを意味します。

使用量と可用性

過去24時間
リクエスト数
成功率
P95 レイテンシ
合計トークン数
モデルパフォーマンス
プライバシーおよびデータ量のしきい値に達すると、メトリクスが表示されます。

データはステータスチェックを除外した、集計済みのユーザーリクエストに基づいています。

Consoleで開く

ConsoleでQwen3-TTS 1.7B VoiceDesignを開き、プロンプトを編集・送信できます。

qwen3-tts-1-7b-voicedesignと/v1/audio/speechで音声をテスト。結果とコストを表示します。

ユースケース

  • ゲームのキャラクターボイス

    「無愛想なドワーフの鍛冶屋」や「神経質な若い運び屋」のように各キャラクターを説明し、声優を雇うことなくセリフを生成できます。

  • ブランドボイスの探索

    「自信に満ちた低音」対「明るく早口」など、企業ボイスの複数の説明を試し、同じスクリプトで比較できます。

  • 表現力豊かなナレーション

    「声を潜めて緊張した様子」から「安堵して温かい様子」へといった指示を使い、一つのプロジェクト内でナレーションを演出できます。

  • 動画用プロトタイプ音声

    最終的な声優を決定する前に、絵コンテや解説動画用の一時的なナレーターを作成できます。

プロンプト例

音声:中年の女性、穏やかで低い声、ドキュメンタリーのナレーターのようにゆっくり話す。テキスト:The river has changed course three times in the last century.

音声:若い男性、興奮して少し息を切らしている、早口。テキスト:You will not believe what just came through the door.

音声:特に怒った口調で、速くぶっきらぼうに(用特别愤怒的语气说)。テキスト:这已经是第三次了,你们到底有没有在听?

FAQ

Qwen3-TTS VoiceDesignの用途は何ですか?

言葉で指定した音声で読み上げを行います。名前付きの話者を選択する代わりに、感情、トーン、話し方を記述することで、それに従った音声を生成します。ストックのプリセットに合わないキャラクターやブランドボイスに適しています。

CustomVoiceとの違いは何ですか?

CustomVoiceは9種類の固定された名前付き話者を提供します。VoiceDesignには固定リストがなく、説明文から音声を構築します。新しい音声を生成したい場合はVoiceDesignを、安定した再現性のある話者が必要な場合はCustomVoiceを選択してください。

どの言語に対応していますか?

中国語、英語、日本語、韓国語、ドイツ語、フランス語、ロシア語、ポルトガル語、スペイン語、イタリア語の10言語と、いくつかの方言バリアントに対応しています。音声の説明はモデルが理解できる言語で記述してください(モデルカードの例では中国語が使用されています)。

実在の人物の声をクローンできますか?

Qwen3-TTSファミリーは短いサンプルからの音声クローニングについて説明していますが、このバリアントは指示に基づく設計に重点を置いています。許可を得た音声のみをクローンまたは模倣し、出力結果が自身の同意ルールに準拠しているか確認してください。

呼び出しごとに音声は同一になりますか?

保証されません。説明文は音声を誘導しますが、正確な音色を固定するものではないため、繰り返し呼び出すとわずかに異なる場合があります。長期プロジェクトで正確な再現性が必要な場合は、固定されたプリセット話者を使用してください。

Qwen3-TTS 1.7B VoiceDesign の料金はいくらですか?

TokenLab では Qwen3-TTS 1.7B VoiceDesign は - です。詳細は上の料金表を参照してください。 料金は課金単位・仕様・使用量によって異なります。モデルの詳細な料金で同条件同士を比較してください。単一のレートで総額は決まりません。

Qwen3-TTS 1.7B VoiceDesign はどのエンドポイントを使うべきですか?

Qwen3-TTS 1.7B VoiceDesign のデフォルトは https://api.tokenlab.sh/v1/audio/speech です。プロバイダーネイティブ形式に対応している場合は、API workbench にそのエンドポイントも表示されます。

Qwen3-TTS 1.7B VoiceDesign はどの操作に対応していますか?

Qwen3-TTS 1.7B VoiceDesign は テキスト読み上げ に対応しています。上の API workbench で操作を選ぶと、対応するエンドポイントとコード例が表示されます。

Qwen3-TTS 1.7B VoiceDesign を比較する

ソース

2026/10/02 時点での評価

Qwen TTS の他のモデル

関連モデル