Alibaba: CosyVoice v3.5 Plus
cosyvoice-v3.5-plus- Eingabe / Ausgabe
- $22.06 / $0.00
- Modalitäten
- Audio
Über CosyVoice v3.5 Plus
CosyVoice v3.5 Plus ist Alibabas Sprachsynthese-Modell für Stimmen, die Sie selbst erstellen. Es gibt keine Liste mit Standardstimmen: Sie klonen eine Stimme aus einem Beispiel oder entwerfen eine anhand einer Textbeschreibung und synthetisieren dann über eine WebSocket-Verbindung. Es spricht Mandarin, Englisch und mehrere andere Sprachen sowie viele chinesische regionale Dialekte und akzeptiert Anweisungen in natürlicher Sprache, um die Sprachausgabe zu steuern, was Qwen3-TTS-Flash nicht kann.
Stärken
- Funktioniert mit geklonten Stimmen aus einer Aufnahme oder Stimmen, die aus einer schriftlichen Beschreibung entworfen wurden.
- Akzeptiert Anweisungen zur Steuerung von Tonfall und Sprechstil.
- Spricht Mandarin, Kantonesisch und viele chinesische regionale Dialekte sowie Englisch, Französisch, Deutsch, Japanisch, Koreanisch, Russisch, Portugiesisch, Thailändisch, Indonesisch und Vietnamesisch.
- Streamt Audio über WebSocket, sodass die Wiedergabe beginnen kann, bevor die Synthese abgeschlossen ist.
Alternativen
- Es gibt keine eingebauten Systemstimmen; Sie müssen zuerst eine geklonte oder entworfene Stimme erstellen.
- Es erfordert einen WebSocket-Client anstelle einer einfachen HTTP-Anfrage.
- Das Klonen von Stimmen erfordert ein sauberes Referenzbeispiel und die Zustimmung zur Verwendung dieser Stimme.
Erste Schritte
API-Schlüssel erstellen
Erstelle einen Schlüssel in Console und nutze ihn mit jedem Modell auf der Plattform.
Senden Sie Ihre erste Anfrage
Kopieren Sie das Beispiel für Ihre Sprache und führen Sie es gegen den Endpunkt aus.
Text zu SpracheTokenLab-EndpunktPOST/v1/audio/speechcurl -X POST "https://api.tokenlab.sh/v1/audio/speech" \ -H "Authorization: Bearer sk-xxx" \ -H "Content-Type: application/json" \ -d '{ "operation": "tts", "response_format": "mp3", "speed": 1, "model": "cosyvoice-v3.5-plus", "input": "Hello from TokenLab.", "voice": "alloy" }'
Preise
Der offizielle Preis ist die öffentliche Basisvorgabe des Modellerstellers. Der TokenLab-Preis ist das, was du für dieses Modell auf TokenLab zahlst.
Cosy Tts Number
Pro 1 Mio. Zeichen- Offizieller Preis
- Eingabe $22.06 / Ausgabe $0.00
- Official
- Eingabe $22.06 / Ausgabe $0.00
- Rabatt
- —
| Offizieller PreisPro 1 Mio. Zeichen | OfficialPro 1 Mio. Zeichen | Rabatt | |
|---|---|---|---|
| Cosy Tts Number | Eingabe $22.06 / Ausgabe $0.00 | Eingabe $22.06 / Ausgabe $0.00 | — |
Nutzung & Aktivität
Die Erfolgsquote ist der Anteil abgeschlossener Anfragen. Die Latenz ist die Dauer einer vollständigen Antwort; P95 bedeutet, dass 95 % der Anfragen innerhalb dieser Zeit abgeschlossen wurden.
Nutzung & Verfügbarkeit
Letzte 24 Stunden- Anfragen
- Erfolgsrate
- P95-Latenz
- Token gesamt
Die Daten basieren auf aggregierten Benutzeranfragen, Statusprüfungen sind ausgeschlossen.
In Console öffnen
Öffne CosyVoice v3.5 Plus in Console mit einer bearbeitbaren oder versandbereiten Eingabeaufforderung.
Teste cosyvoice-v3.5-plus mit einer kurzen Audio-Anfrage an /v1/audio/speech. Zeige Ergebnis und Kosten.
Anwendungsfälle
Markenstimme
Klonen Sie einen zugelassenen Sprecher einmal und verwenden Sie die Stimme für Produkttouren, IVR-Ansagen und Ankündigungen.
Charakterstimmen
Entwerfen Sie eine Stimme anhand einer Beschreibung, z. B. ein herzlicher älterer Geschichtenerzähler, für Hörbücher oder Spiele.
Erzählung in regionalen Dialekten
Produzieren Sie gesprochene Inhalte in Sichuan-, Shanghai- oder Kantonesisch-Dialekten für lokales Publikum.
Prompt-Beispiele
Lies diese Ankündigung in einem flotten, fröhlichen Tonfall mit einer kurzen Pause nach dem Datum.
Sprich den folgenden Absatz langsam und herzlich, als würdest du eine Gute-Nacht-Geschichte vorlesen.
Sag dies auf Kantonesisch in einem entspannten, konversationellen Tempo.
FAQ
Hat CosyVoice v3.5 Plus voreingestellte Stimmen?
Nein. Alibaba listet keine Systemstimmen für dieses Modell auf. Sie benötigen eine geklonte Stimme aus einem Beispiel oder eine entworfene Stimme aus einer Textbeschreibung, die Sie dann bei der Synthese übergeben.
Welche Sprachen und Dialekte werden unterstützt?
Mandarin, Kantonesisch und viele chinesische regionale Dialekte sowie Englisch, Französisch, Deutsch, Japanisch, Koreanisch, Russisch, Portugiesisch, Thailändisch, Indonesisch und Vietnamesisch. Die Dialektunterstützung ist ein wesentlicher Unterschied zu den Qwen3-TTS-Flash-Modellen.
Kann ich steuern, wie es klingt?
Ja. Das Modell unterstützt die Steuerung durch Anweisungen, sodass Sie Tonfall, Emotion oder Tempo in natürlicher Sprache beschreiben können. Die Wahl der Stimme legt fest, wer spricht; die Anweisung bestimmt, wie der Text vorgetragen wird.
Wie wird es aufgerufen?
Über eine WebSocket-API, die Audio während der Generierung streamt. Dies eignet sich für lange Skripte und Live-Wiedergabe, erfordert jedoch einen Client, der die Verbindung verwaltet.
Wann sollte ich stattdessen Qwen3-TTS-Flash wählen?
Wenn Sie fertige Stimmen und einen einfachen HTTP-Aufruf wünschen und kein Klonen oder Anweisungen benötigen. Wählen Sie CosyVoice, wenn die Identität der Stimme oder der Vortragsstil Teil Ihres Produkts sind.
Was kostet CosyVoice v3.5 Plus?
Auf TokenLab kostet CosyVoice v3.5 Plus Eingabe $22.06 / Ausgabe $0.00 Pro 1 Mio. Zeichen. Die vollständige Aufschlüsselung steht in der Preistabelle oben. Die Preise hängen von Abrechnungseinheit, Spezifikation und Nutzung ab. Vergleichen Sie gleiche Bedingungen in der detaillierten Preisliste des Modells; eine einzelne Rate bestimmt nicht die Gesamtkosten.
Welchen Endpunkt soll CosyVoice v3.5 Plus verwenden?
Verwenden Sie https://api.tokenlab.sh/v1/audio/speech für CosyVoice v3.5 Plus. Das folgende Anforderungsbeispiel zeigt die passende Code-Struktur.
Welche Operationen unterstützt CosyVoice v3.5 Plus?
CosyVoice v3.5 Plus unterstützt Text zu Sprache. Wählen Sie oben einen Vorgang aus, um dessen Endpunkt und Anforderungsbeispiel anzuzeigen.
CosyVoice v3.5 Plus vergleichen
Quellen
Geprüft am 02.10.2026