Wählen Sie Auto, TokenLab Verified oder Official für jede Anfrage, wobei die Preise vorab angezeigt werden.Neuigkeiten ansehen

Alibaba: CosyVoice v3.5 Plus

CosyVoice v3.5 Plus verwandelt geschriebene Skripte in ausdrucksstarke Sprache. Nutzen Sie es für vertonte Artikel, konversationelle Voiceovers und gesprochene Produktanleitungen, wobei Stimme und Sprechgeschwindigkeit passend zum Publikum gewählt werden können.
Modelle vergleichen
cosyvoice-v3.5-plus
VerfügbarAlibabaText zu SpracheSynchron
Eingabe / Ausgabe
$22.06 / $0.00
Modalitäten
Audio

Über CosyVoice v3.5 Plus

CosyVoice v3.5 Plus ist Alibabas Sprachsynthese-Modell für Stimmen, die Sie selbst erstellen. Es gibt keine Liste mit Standardstimmen: Sie klonen eine Stimme aus einem Beispiel oder entwerfen eine anhand einer Textbeschreibung und synthetisieren dann über eine WebSocket-Verbindung. Es spricht Mandarin, Englisch und mehrere andere Sprachen sowie viele chinesische regionale Dialekte und akzeptiert Anweisungen in natürlicher Sprache, um die Sprachausgabe zu steuern, was Qwen3-TTS-Flash nicht kann.

Stärken

  • Funktioniert mit geklonten Stimmen aus einer Aufnahme oder Stimmen, die aus einer schriftlichen Beschreibung entworfen wurden.
  • Akzeptiert Anweisungen zur Steuerung von Tonfall und Sprechstil.
  • Spricht Mandarin, Kantonesisch und viele chinesische regionale Dialekte sowie Englisch, Französisch, Deutsch, Japanisch, Koreanisch, Russisch, Portugiesisch, Thailändisch, Indonesisch und Vietnamesisch.
  • Streamt Audio über WebSocket, sodass die Wiedergabe beginnen kann, bevor die Synthese abgeschlossen ist.

Alternativen

  • Es gibt keine eingebauten Systemstimmen; Sie müssen zuerst eine geklonte oder entworfene Stimme erstellen.
  • Es erfordert einen WebSocket-Client anstelle einer einfachen HTTP-Anfrage.
  • Das Klonen von Stimmen erfordert ein sauberes Referenzbeispiel und die Zustimmung zur Verwendung dieser Stimme.

Erste Schritte

  1. API-Schlüssel erstellen

    Erstelle einen Schlüssel in Console und nutze ihn mit jedem Modell auf der Plattform.

  2. Senden Sie Ihre erste Anfrage

    Kopieren Sie das Beispiel für Ihre Sprache und führen Sie es gegen den Endpunkt aus.

    Text zu SpracheTokenLab-Endpunkt
    POST/v1/audio/speech
    curl -X POST "https://api.tokenlab.sh/v1/audio/speech" \
      -H "Authorization: Bearer sk-xxx" \
      -H "Content-Type: application/json" \
      -d '{
      "operation": "tts",
      "response_format": "mp3",
      "speed": 1,
      "model": "cosyvoice-v3.5-plus",
      "input": "Hello from TokenLab.",
      "voice": "alloy"
    }'

Preise

Der offizielle Preis ist die öffentliche Basisvorgabe des Modellerstellers. Der TokenLab-Preis ist das, was du für dieses Modell auf TokenLab zahlst.

Cosy Tts Number

Pro 1 Mio. Zeichen
Offizieller Preis
Eingabe $22.06 / Ausgabe $0.00
Official
Eingabe $22.06 / Ausgabe $0.00
Rabatt
—

Nutzung & Aktivität

Die Erfolgsquote ist der Anteil abgeschlossener Anfragen. Die Latenz ist die Dauer einer vollständigen Antwort; P95 bedeutet, dass 95 % der Anfragen innerhalb dieser Zeit abgeschlossen wurden.

Nutzung & Verfügbarkeit

Letzte 24 Stunden
Anfragen
Erfolgsrate
P95-Latenz
Token gesamt
Modellleistung
Metriken erscheinen, sobald die Schwellenwerte für Datenschutz und Datenvolumen erreicht sind.

Die Daten basieren auf aggregierten Benutzeranfragen, Statusprüfungen sind ausgeschlossen.

In Console öffnen

Öffne CosyVoice v3.5 Plus in Console mit einer bearbeitbaren oder versandbereiten Eingabeaufforderung.

Teste cosyvoice-v3.5-plus mit einer kurzen Audio-Anfrage an /v1/audio/speech. Zeige Ergebnis und Kosten.

Anwendungsfälle

  • Markenstimme

    Klonen Sie einen zugelassenen Sprecher einmal und verwenden Sie die Stimme für Produkttouren, IVR-Ansagen und Ankündigungen.

  • Charakterstimmen

    Entwerfen Sie eine Stimme anhand einer Beschreibung, z. B. ein herzlicher älterer Geschichtenerzähler, für Hörbücher oder Spiele.

  • Erzählung in regionalen Dialekten

    Produzieren Sie gesprochene Inhalte in Sichuan-, Shanghai- oder Kantonesisch-Dialekten für lokales Publikum.

Prompt-Beispiele

Lies diese Ankündigung in einem flotten, fröhlichen Tonfall mit einer kurzen Pause nach dem Datum.

Sprich den folgenden Absatz langsam und herzlich, als würdest du eine Gute-Nacht-Geschichte vorlesen.

Sag dies auf Kantonesisch in einem entspannten, konversationellen Tempo.

FAQ

Hat CosyVoice v3.5 Plus voreingestellte Stimmen?

Nein. Alibaba listet keine Systemstimmen für dieses Modell auf. Sie benötigen eine geklonte Stimme aus einem Beispiel oder eine entworfene Stimme aus einer Textbeschreibung, die Sie dann bei der Synthese übergeben.

Welche Sprachen und Dialekte werden unterstützt?

Mandarin, Kantonesisch und viele chinesische regionale Dialekte sowie Englisch, Französisch, Deutsch, Japanisch, Koreanisch, Russisch, Portugiesisch, Thailändisch, Indonesisch und Vietnamesisch. Die Dialektunterstützung ist ein wesentlicher Unterschied zu den Qwen3-TTS-Flash-Modellen.

Kann ich steuern, wie es klingt?

Ja. Das Modell unterstützt die Steuerung durch Anweisungen, sodass Sie Tonfall, Emotion oder Tempo in natürlicher Sprache beschreiben können. Die Wahl der Stimme legt fest, wer spricht; die Anweisung bestimmt, wie der Text vorgetragen wird.

Wie wird es aufgerufen?

Über eine WebSocket-API, die Audio während der Generierung streamt. Dies eignet sich für lange Skripte und Live-Wiedergabe, erfordert jedoch einen Client, der die Verbindung verwaltet.

Wann sollte ich stattdessen Qwen3-TTS-Flash wählen?

Wenn Sie fertige Stimmen und einen einfachen HTTP-Aufruf wünschen und kein Klonen oder Anweisungen benötigen. Wählen Sie CosyVoice, wenn die Identität der Stimme oder der Vortragsstil Teil Ihres Produkts sind.

Was kostet CosyVoice v3.5 Plus?

Auf TokenLab kostet CosyVoice v3.5 Plus Eingabe $22.06 / Ausgabe $0.00 Pro 1 Mio. Zeichen. Die vollständige Aufschlüsselung steht in der Preistabelle oben. Die Preise hängen von Abrechnungseinheit, Spezifikation und Nutzung ab. Vergleichen Sie gleiche Bedingungen in der detaillierten Preisliste des Modells; eine einzelne Rate bestimmt nicht die Gesamtkosten.

Welchen Endpunkt soll CosyVoice v3.5 Plus verwenden?

Verwenden Sie https://api.tokenlab.sh/v1/audio/speech für CosyVoice v3.5 Plus. Das folgende Anforderungsbeispiel zeigt die passende Code-Struktur.

Welche Operationen unterstützt CosyVoice v3.5 Plus?

CosyVoice v3.5 Plus unterstützt Text zu Sprache. Wählen Sie oben einen Vorgang aus, um dessen Endpunkt und Anforderungsbeispiel anzuzeigen.

CosyVoice v3.5 Plus vergleichen

Quellen

Geprüft am 02.10.2026

Ähnliche Modelle