Wählen Sie Auto, TokenLab Verified oder Official für jede Anfrage, wobei die Preise vorab angezeigt werden.Neuigkeiten ansehen

Alibaba: Qwen3-TTS 1.7B VoiceDesign

Qwen3-TTS 1.7B VoiceDesign ist ein Text-zu-Sprache-Modell von Alibaba, das benutzerdefinierte Stimmen aus natürlichsprachlichen Beschreibungen erstellt, die Emotion, Tonfall und Prosodie spezifizieren. Es unterstützt Voice-Cloning anhand eines 3-sekündigen Audiosamples, generiert Sprache in über 10 Sprachen, darunter Chinesisch, Englisch, Japanisch, Koreanisch und europäische Sprachen, und erreicht eine Latenz von nur 97 ms.
Modelle vergleichen
qwen3-tts-1-7b-voicedesign
VerfügbarAlibabaText zu SpracheSynchron
Preis
Ab $0.000015
Modalitäten
Audio

Über Qwen3-TTS 1.7B VoiceDesign

Qwen3-TTS 1.7B VoiceDesign ist die Text-zu-Sprache-Variante von Alibaba, die eine Stimme aus einer schriftlichen Beschreibung erstellt, anstatt aus einer voreingestellten Liste. Sie beschreiben Emotion, Tonfall und Prosodie in natürlicher Sprache, und das Modell spricht den Text mit dieser Stimme. Es deckt zehn Sprachen ab und ist für Fälle gedacht, in denen kein existierender Sprecher zum Charakter oder zur Marke passt, die Sie im Sinn haben.

Stärken

  • Eine Stimme wird durch eine Beschreibung definiert, wie z. B. ein älterer Erzähler mit einer langsamen, warmen Darbietung, anstatt aus einer festen Liste gewählt zu werden.
  • Timbre, Emotion und Prosodie können alle durch Anweisungen gesteuert werden, einschließlich starker Stimmungen wie Wut.
  • Zehn Sprachen werden abgedeckt: Chinesisch, Englisch, Japanisch, Koreanisch, Deutsch, Französisch, Russisch, Portugiesisch, Spanisch und Italienisch, sowie Dialektvarianten.
  • Alibaba listet eine niedrige Syntheselatenz von etwa 97 ms für die Qwen3-TTS-Familie, sodass es für interaktive Anwendungen geeignet ist.

Alternativen

  • Dieselbe Beschreibung kann bei verschiedenen Aufrufen leicht unterschiedliche Stimmen ergeben; daher ist es eine schwächere Wahl, wenn eine exakte Stimme über Monate hinweg wiederholt werden muss.
  • Wenn Sie einen festen, benannten Sprecher wünschen, ist die CustomVoice-Variante mit neun Presets vorhersehbarer.
  • Die Qualität hängt davon ab, wie klar Sie die Stimme beschreiben; vage Beschreibungen führen zu generischen Ergebnissen.

Erste Schritte

  1. API-Schlüssel erstellen

    Erstelle einen Schlüssel in Console und nutze ihn mit jedem Modell auf der Plattform.

  2. Senden Sie Ihre erste Anfrage

    Kopieren Sie das Beispiel für Ihre Sprache und führen Sie es gegen den Endpunkt aus.

    Text zu SpracheTokenLab-Endpunkt
    POST/v1/audio/speech
    curl -X POST "https://api.tokenlab.sh/v1/audio/speech" \
      -H "Authorization: Bearer sk-xxx" \
      -H "Content-Type: application/json" \
      -d '{
      "operation": "tts",
      "model": "qwen3-tts-1-7b-voicedesign",
      "input": "Hello from TokenLab.",
      "voice": "alloy"
    }'

Preise

Der offizielle Preis ist die öffentliche Basisvorgabe des Modellerstellers. Der TokenLab-Preis ist das, was du für dieses Modell auf TokenLab zahlst.

Text zu Sprache

Pro 1 Mio. Zeichen
Offizieller Preis
$0.000015
Official
$0.000015
Rabatt
—

Nutzung & Aktivität

Die Erfolgsquote ist der Anteil abgeschlossener Anfragen. Die Latenz ist die Dauer einer vollständigen Antwort; P95 bedeutet, dass 95 % der Anfragen innerhalb dieser Zeit abgeschlossen wurden.

Nutzung & Verfügbarkeit

Letzte 24 Stunden
Anfragen
Erfolgsrate
P95-Latenz
Token gesamt
Modellleistung
Metriken erscheinen, sobald die Schwellenwerte für Datenschutz und Datenvolumen erreicht sind.

Die Daten basieren auf aggregierten Benutzeranfragen, Statusprüfungen sind ausgeschlossen.

In Console öffnen

Öffne Qwen3-TTS 1.7B VoiceDesign in Console mit einer bearbeitbaren oder versandbereiten Eingabeaufforderung.

Teste qwen3-tts-1-7b-voicedesign mit einer kurzen Audio-Anfrage an /v1/audio/speech. Zeige Ergebnis und Kosten.

Anwendungsfälle

  • Charakterstimmen für Spiele

    Beschreiben Sie jeden Charakter, zum Beispiel einen mürrischen Zwergenschmied oder einen nervösen jungen Kurier, und generieren Sie Dialogzeilen, ohne vorher einen Synchronsprecher engagieren zu müssen.

  • Erkundung von Markenstimmen

    Probieren Sie verschiedene Beschreibungen einer Unternehmensstimme aus, wie z. B. „selbstbewusst und tief“ versus „hell und schnell“, und vergleichen Sie diese mit demselben Skript.

  • Ausdrucksstarke Narration

    Direkte Darbietung für Erzählabschnitte mit Anweisungen wie „gedämpft und angespannt“, dann „erleichtert und warm“, innerhalb eines Projekts.

  • Prototyp-Stimmen für Videos

    Erstellen Sie einen temporären Erzähler für ein Storyboard oder Erklärvideo, bevor die endgültige Stimme besetzt wird.

Prompt-Beispiele

Stimme: eine Frau mittleren Alters, ruhig und tief, spricht langsam wie ein Dokumentarsprecher. Text: The river has changed course three times in the last century.

Stimme: ein junger Mann, aufgeregt und leicht außer Atem, schnelles Tempo. Text: You will not believe what just came through the door.

Stimme: in einem besonders wütenden Tonfall sprechen, schnell und abgehackt (用特别愤怒的语气说). Text: 这已经是第三次了,你们到底有没有在听?

FAQ

Wofür ist Qwen3-TTS VoiceDesign gedacht?

Es generiert Sprache in einer Stimme, die Sie in Worten spezifizieren. Anstatt einen benannten Sprecher auszuwählen, schreiben Sie eine Beschreibung, die Emotion, Tonfall und Darbietung abdeckt, und das Modell produziert Audio, das diesen Vorgaben folgt. Es eignet sich für Charaktere und Markenstimmen, die nicht zu einem Standard-Preset passen.

Wie unterscheidet es sich von CustomVoice?

CustomVoice bietet neun feste, benannte Sprecher mit optionalen Stilanweisungen. VoiceDesign hat keine feste Liste und baut die Stimme aus Ihrer Beschreibung auf. Wählen Sie VoiceDesign, um etwas Neues zu erschaffen, und CustomVoice für einen stabilen, wiederholbaren Sprecher.

Welche Sprachen werden unterstützt?

Zehn: Chinesisch, Englisch, Japanisch, Koreanisch, Deutsch, Französisch, Russisch, Portugiesisch, Spanisch und Italienisch, zusammen mit einigen Dialektvarianten. Schreiben Sie die Stimmenbeschreibung in einer Sprache, die das Modell versteht; das Beispiel auf der Modellkarte verwendet Chinesisch.

Kann ich damit die Stimme einer echten Person klonen?

Die Qwen3-TTS-Familie beschreibt das Stimmenklonen anhand eines kurzen Samples, aber der Fokus dieser Variante liegt auf dem anweisungsbasierten Design. Klonen oder imitieren Sie nur Stimmen, für die Sie eine Erlaubnis haben, und überprüfen Sie die Ausgabe anhand Ihrer eigenen Zustimmungsregeln.

Wird die Stimme bei jedem Aufruf identisch sein?

Nicht garantiert. Eine Beschreibung steuert die Stimme, legt aber kein exaktes Timbre fest, sodass wiederholte Aufrufe leicht unterschiedlich klingen können. Wenn Sie eine exakte Wiederholung über ein langes Projekt benötigen, verwenden Sie stattdessen einen festen Preset-Sprecher.

Was kostet Qwen3-TTS 1.7B VoiceDesign?

Auf TokenLab kostet Qwen3-TTS 1.7B VoiceDesign - . Die vollständige Aufschlüsselung steht in der Preistabelle oben. Die Preise hängen von Abrechnungseinheit, Spezifikation und Nutzung ab. Vergleichen Sie gleiche Bedingungen in der detaillierten Preisliste des Modells; eine einzelne Rate bestimmt nicht die Gesamtkosten.

Welchen Endpunkt soll Qwen3-TTS 1.7B VoiceDesign verwenden?

Verwenden Sie https://api.tokenlab.sh/v1/audio/speech für Qwen3-TTS 1.7B VoiceDesign. Das folgende Anforderungsbeispiel zeigt die passende Code-Struktur.

Welche Operationen unterstützt Qwen3-TTS 1.7B VoiceDesign?

Qwen3-TTS 1.7B VoiceDesign unterstützt Text zu Sprache. Wählen Sie oben einen Vorgang aus, um dessen Endpunkt und Anforderungsbeispiel anzuzeigen.

Qwen3-TTS 1.7B VoiceDesign vergleichen

Quellen

Geprüft am 02.10.2026

Mehr aus der Qwen TTS-Serie

Ähnliche Modelle