Alibaba: CosyVoice v3.5 Plus
cosyvoice-v3.5-plus- Entrée / Sortie
- $22.06 / $0.00
- Modalités
- Audio
À propos de CosyVoice v3.5 Plus
CosyVoice v3.5 Plus est le modèle de synthèse vocale d'Alibaba pour les voix que vous créez vous-même. Il n'a pas de liste de voix prédéfinies : vous clonez une voix à partir d'un échantillon ou en concevez une à partir d'une description textuelle, puis vous synthétisez avec via une connexion WebSocket. Il parle mandarin, anglais et plusieurs autres langues, ainsi que de nombreux dialectes régionaux chinois, et il accepte des instructions en langage naturel pour orienter le rendu, ce que Qwen3-TTS-Flash ne fait pas.
Points forts
- Fonctionne avec des voix clonées à partir d'un enregistrement ou des voix conçues à partir d'une description écrite.
- Accepte des instructions pour contrôler le ton et le style d'élocution.
- Parle mandarin, cantonais et de nombreux dialectes régionaux chinois ainsi qu'anglais, français, allemand, japonais, coréen, russe, portugais, thaï, indonésien et vietnamien.
- Diffuse l'audio via WebSocket, de sorte que la lecture peut commencer avant la fin de la synthèse.
Quand préférer un autre modèle
- Il n'a pas de voix système intégrées ; vous devez d'abord créer une voix clonée ou conçue.
- Il nécessite un client WebSocket plutôt qu'une simple requête HTTP.
- Le clonage vocal nécessite un échantillon de référence propre et le consentement pour utiliser cette voix.
Pour commencer
Créer une clé API
Générez une clé dans Console et utilisez-la avec tous les modèles de la plateforme.
Envoyez votre première requête
Copiez l'exemple pour votre langage et lancez-le.
Texte vers paroleEndpoint TokenLabPOST/v1/audio/speechcurl -X POST "https://api.tokenlab.sh/v1/audio/speech" \ -H "Authorization: Bearer sk-xxx" \ -H "Content-Type: application/json" \ -d '{ "operation": "tts", "response_format": "mp3", "speed": 1, "model": "cosyvoice-v3.5-plus", "input": "Hello from TokenLab.", "voice": "alloy" }'
Tarification
Le tarif officiel est la référence publique du créateur du modèle. Le tarif TokenLab est ce que vous payez pour ce modèle sur TokenLab.
Cosy Tts Number
Par million de caractères- Tarif Official
- Entrée $22.06 / Sortie $0.00
- Official
- Entrée $22.06 / Sortie $0.00
- Remise
- —
| Tarif OfficialPar million de caractères | OfficialPar million de caractères | Remise | |
|---|---|---|---|
| Cosy Tts Number | Entrée $22.06 / Sortie $0.00 | Entrée $22.06 / Sortie $0.00 | — |
Utilisation et activité
Le taux de réussite est la part de requêtes abouties. La latence est la durée d'une réponse complète ; P95 signifie que 95 % des requêtes ont fini dans ce délai.
Utilisation et disponibilité
Dernières 24 heures- Requêtes
- Taux de succès
- Latence P95
- Total des jetons
Les données sont basées sur les requêtes agrégées des utilisateurs, à l'exclusion des vérifications de statut.
Ouvrir dans Console
Ouvrez CosyVoice v3.5 Plus dans Console avec un prompt prêt à modifier ou envoyer.
Aide-moi à tester cosyvoice-v3.5-plus avec une requête audio sur /v1/audio/speech. Affiche le résultat et le coût.
Cas d'usage
Voix de marque
Clonez un locuteur approuvé une fois et utilisez la voix pour des présentations de produits, des invites IVR et des annonces.
Voix de personnages
Concevez une voix à partir d'une description, comme celle d'un conteur âgé et chaleureux, pour des livres audio ou des jeux.
Narration en dialecte régional
Produisez du contenu parlé en dialecte du Sichuan, de Shanghai ou en cantonais pour des publics locaux.
Exemples de prompts
Lisez cette annonce sur un ton vif et enjoué, avec une courte pause après la date.
Prononcez le paragraphe suivant lentement et chaleureusement, comme si vous lisiez une histoire pour dormir.
Dites ceci en cantonais avec un débit détendu et conversationnel.
FAQ
CosyVoice v3.5 Plus possède-t-il des voix prédéfinies ?
Non. Alibaba ne liste aucune voix système pour ce modèle. Vous avez besoin d'une voix clonée à partir d'un échantillon ou d'une voix conçue à partir d'une description textuelle, puis vous transmettez cette voix lors de la synthèse.
Quelles langues et quels dialectes prend-il en charge ?
Mandarin, cantonais et de nombreux dialectes régionaux chinois, ainsi qu'anglais, français, allemand, japonais, coréen, russe, portugais, thaï, indonésien et vietnamien. La prise en charge des dialectes est une différence majeure par rapport aux modèles Qwen3-TTS-Flash.
Puis-je contrôler la sonorité ?
Oui. Le modèle prend en charge le contrôle par instruction, vous pouvez donc décrire le ton, l'émotion ou le rythme en langage naturel. Le choix de la voix définit qui parle ; l'instruction façonne la manière dont la phrase est délivrée.
Comment est-il appelé ?
Via une API WebSocket qui diffuse l'audio au fur et à mesure de sa génération. Cela convient aux longs scripts et à la lecture en direct, mais vous aurez besoin d'un client qui gère la connexion.
Quand devrais-je choisir Qwen3-TTS-Flash à la place ?
Lorsque vous souhaitez des voix prêtes à l'emploi et un simple appel HTTP et que vous n'avez pas besoin de clonage ou d'instructions. Choisissez CosyVoice lorsque l'identité vocale ou le style de rendu fait partie intégrante de votre produit.
Combien coûte CosyVoice v3.5 Plus ?
Sur TokenLab, CosyVoice v3.5 Plus coûte Entrée $22.06 / Sortie $0.00 Par million de caractères. La table tarifaire ci-dessus en montre le détail complet. Les tarifs dépendent de l’unité de facturation, de la spécification et de l’usage. Comparez des conditions identiques dans la tarification détaillée du modèle ; un tarif seul ne détermine pas le coût total.
Quel endpoint CosyVoice v3.5 Plus doit-il utiliser ?
Utilisez https://api.tokenlab.sh/v1/audio/speech pour CosyVoice v3.5 Plus. L'exemple de requête ci-dessous montre la structure de code correspondante.
Quelles opérations CosyVoice v3.5 Plus prend-il en charge ?
CosyVoice v3.5 Plus prend en charge Texte vers parole. Sélectionnez une opération pour voir l'endpoint et un exemple.
Comparer CosyVoice v3.5 Plus
Sources
Mis à jour le 2 oct. 2026