Wählen Sie Auto, TokenLab Verified oder Official für jede Anfrage, wobei die Preise vorab angezeigt werden.Neuigkeiten ansehen

Alibaba: Qwen3-TTS 1.7B CustomVoice

Qwen3-TTS 1.7B CustomVoice ist ein Text-zu-Sprache-Modell von Alibaba, das neun hochwertige voreingestellte Klangfarben in verschiedenen Kombinationen aus Geschlecht, Alter, Sprache und Dialekt bietet. Es ermöglicht eine präzise Stilsteuerung der Zielstimmen durch Benutzeranweisungen, unterstützt Voice-Cloning anhand eines 3-sekündigen Samples und generiert Sprache in über 10 Sprachen mit einer Latenz von nur 97 ms.
Modelle vergleichen
qwen3-tts-1-7b-customvoice
VerfügbarAlibabaText zu SpracheSynchron
Preis
Ab $0.000015
Modalitäten
Audio

Über Qwen3-TTS 1.7B CustomVoice

Qwen3-TTS 1.7B CustomVoice ist das Text-zu-Sprache-Modell von Alibaba, das auf einem festen Satz von neun voreingestellten Stimmen basiert. Sie wählen einen Sprecher per Namen aus und können eine Anweisung in natürlicher Sprache zu Tonfall, Emotion oder Sprechstil hinzufügen. Es spricht zehn Sprachen, darunter Chinesisch, Englisch, Japanisch, Koreanisch sowie mehrere europäische Sprachen, und Alibaba gibt die End-to-End-Syntheselatenz für interaktive Anwendungen mit bis zu 97 ms an.

Stärken

  • Neun benannte Premium-Sprecher decken verschiedene Geschlechter, Altersgruppen, Sprachen und Dialekte ab, sodass eine Stimme über ein ganzes Produkt hinweg konsistent bleiben kann.
  • Eine schriftliche Anweisung kann Emotion und Sprechweise steuern, ohne den gewählten Sprecher zu ändern.
  • Zehn Sprachen werden unterstützt: Chinesisch, Englisch, Japanisch, Koreanisch, Deutsch, Französisch, Russisch, Portugiesisch, Spanisch und Italienisch.
  • Alibaba berichtet von einer End-to-End-Latenz von bis zu 97 ms, was sich für Sprachassistenten und Live-Erzählungen eignet.

Alternativen

  • Die Stimmenliste ist fest vorgegeben; um eine neue Stimme anhand einer Beschreibung zu erfinden, ist die VoiceDesign-Variante besser geeignet.
  • Die Ergebnisse sind am besten, wenn ein Sprecher seine eigene Muttersprache liest; ein englisches Preset, das Japanisch liest, kann daher akzentuiert klingen.
  • Rauschhafte oder ungewöhnliche Eingabetexte, wie starkes Markup oder gemischte Symbole, können die Ausgabequalität verringern.

Erste Schritte

  1. API-Schlüssel erstellen

    Erstelle einen Schlüssel in Console und nutze ihn mit jedem Modell auf der Plattform.

  2. Senden Sie Ihre erste Anfrage

    Kopieren Sie das Beispiel für Ihre Sprache und führen Sie es gegen den Endpunkt aus.

    Text zu SpracheTokenLab-Endpunkt
    POST/v1/audio/speech
    curl -X POST "https://api.tokenlab.sh/v1/audio/speech" \
      -H "Authorization: Bearer sk-xxx" \
      -H "Content-Type: application/json" \
      -d '{
      "operation": "tts",
      "model": "qwen3-tts-1-7b-customvoice",
      "input": "Hello from TokenLab.",
      "voice": "alloy"
    }'

Preise

Der offizielle Preis ist die öffentliche Basisvorgabe des Modellerstellers. Der TokenLab-Preis ist das, was du für dieses Modell auf TokenLab zahlst.

Text zu Sprache

Pro 1 Mio. Zeichen
Offizieller Preis
$0.000015
Official
$0.000015
Rabatt
—

Nutzung & Aktivität

Die Erfolgsquote ist der Anteil abgeschlossener Anfragen. Die Latenz ist die Dauer einer vollständigen Antwort; P95 bedeutet, dass 95 % der Anfragen innerhalb dieser Zeit abgeschlossen wurden.

Nutzung & Verfügbarkeit

Letzte 24 Stunden
Anfragen
Erfolgsrate
P95-Latenz
Token gesamt
Modellleistung
Metriken erscheinen, sobald die Schwellenwerte für Datenschutz und Datenvolumen erreicht sind.

Die Daten basieren auf aggregierten Benutzeranfragen, Statusprüfungen sind ausgeschlossen.

In Console öffnen

Öffne Qwen3-TTS 1.7B CustomVoice in Console mit einer bearbeitbaren oder versandbereiten Eingabeaufforderung.

Teste qwen3-tts-1-7b-customvoice mit einer kurzen Audio-Anfrage an /v1/audio/speech. Zeige Ergebnis und Kosten.

Anwendungsfälle

  • Sprachassistenten

    Geben Sie einem In-App-Assistenten eine beständige, benannte Stimme und eine geringe Antwortverzögerung, damit die Wiedergabe der Antworten schnell beginnt, sobald der Text bereit ist.

  • Hörbuch- und Artikelnarration

    Lesen Sie lange Texte mit einem gewählten Sprecher und fügen Sie eine Anweisung wie „ruhig und warm“ hinzu, um die Darbietung über Kapitel hinweg konsistent zu halten.

  • Lokalisierte Produktvideos

    Verwenden Sie die japanischen, koreanischen oder englischen Presets, um dasselbe Skript pro Markt zu vertonen, während die Marke einen wiedererkennbaren Klang beibehält.

  • Spiel- und Charakterdialoge

    Wählen Sie unterschiedliche Presets für verschiedene Charaktere und fügen Sie Emotionsanweisungen für wütende, müde oder aufgeregte Zeilen hinzu.

Prompt-Beispiele

Sprecher: Ryan. Anweisung: ruhig, freundlich, etwas langsam. Text: Welcome back. Your order has shipped and should arrive on Thursday.

Sprecher: Ono_Anna. Anweisung: fröhliche Ansagerin. Text: 本日はご来店いただき、ありがとうございます。

Sprecher: Vivian. Anweisung: flüsternd, als würde man ein Geheimnis erzählen. Text: 你听说了吗?明天会有一个大消息。

FAQ

Welche Stimmen bietet Qwen3-TTS CustomVoice an?

Neun Presets: Vivian, Serena, Uncle_Fu, Dylan und Eric für chinesische Varianten, Ryan und Aiden für Englisch, Ono_Anna für Japanisch und Sohee für Koreanisch. Sie wählen für jede Anfrage einen Namen aus.

Kann ich Emotion und Sprechstil steuern?

Ja. Sie können eine Anweisung in natürlicher Sprache hinzufügen, zum Beispiel „wütend“, „sanft“ oder „schnell und aufgeregt“, und das Modell passt Tonfall und Art an, während das Timbre des gewählten Sprechers erhalten bleibt.

Wie unterscheidet sich CustomVoice von VoiceDesign?

CustomVoice verwendet neun feste Sprecher, die Sie auswählen. VoiceDesign hat keine voreingestellte Liste; Sie beschreiben die gewünschte Stimme in Worten, wie Alter, Stimmung und Prosodie, und das Modell erstellt sie. Wählen Sie CustomVoice für Konsistenz und VoiceDesign für neue Stimmen.

Welche Sprachen spricht es?

Zehn: Chinesisch, Englisch, Japanisch, Koreanisch, Deutsch, Französisch, Russisch, Portugiesisch, Spanisch und Italienisch. Die Modellkarte empfiehlt, jeden Sprecher für die beste Qualität in seiner Muttersprache zu verwenden.

Ist es schnell genug für Live-Konversationen?

Alibaba gibt eine End-to-End-Syntheselatenz von bis zu 97 ms an, die auf Echtzeitanwendungen abzielt. Die tatsächliche Verzögerung in Ihrer App hängt auch von der Netzwerkdistanz und der Textlänge ab; messen Sie diese daher mit Ihrem eigenen Datenverkehr.

Was kostet Qwen3-TTS 1.7B CustomVoice?

Auf TokenLab kostet Qwen3-TTS 1.7B CustomVoice - . Die vollständige Aufschlüsselung steht in der Preistabelle oben. Die Preise hängen von Abrechnungseinheit, Spezifikation und Nutzung ab. Vergleichen Sie gleiche Bedingungen in der detaillierten Preisliste des Modells; eine einzelne Rate bestimmt nicht die Gesamtkosten.

Welchen Endpunkt soll Qwen3-TTS 1.7B CustomVoice verwenden?

Verwenden Sie https://api.tokenlab.sh/v1/audio/speech für Qwen3-TTS 1.7B CustomVoice. Das folgende Anforderungsbeispiel zeigt die passende Code-Struktur.

Welche Operationen unterstützt Qwen3-TTS 1.7B CustomVoice?

Qwen3-TTS 1.7B CustomVoice unterstützt Text zu Sprache. Wählen Sie oben einen Vorgang aus, um dessen Endpunkt und Anforderungsbeispiel anzuzeigen.

Qwen3-TTS 1.7B CustomVoice vergleichen

Quellen

Geprüft am 02.10.2026

Mehr aus der Qwen TTS-Serie

Ähnliche Modelle