Choisissez Auto, TokenLab Verified ou Official pour chaque demande, avec les prix affichés à l'avance.Voir les nouveautés

Alibaba: CosyVoice v3.5 Plus

CosyVoice v3.5 Plus transforme des scripts écrits en une parole expressive. Utilisez-le pour des articles narrés, des voix off conversationnelles et des conseils produits vocaux, avec une voix et une vitesse d'élocution adaptées à l'audience.
Comparer les modèles
cosyvoice-v3.5-plus
DisponibleAlibabaTexte vers paroleSynchrone
Entrée / Sortie
$22.06 / $0.00
Modalités
Audio

À propos de CosyVoice v3.5 Plus

CosyVoice v3.5 Plus est le modèle de synthèse vocale d'Alibaba pour les voix que vous créez vous-même. Il n'a pas de liste de voix prédéfinies : vous clonez une voix à partir d'un échantillon ou en concevez une à partir d'une description textuelle, puis vous synthétisez avec via une connexion WebSocket. Il parle mandarin, anglais et plusieurs autres langues, ainsi que de nombreux dialectes régionaux chinois, et il accepte des instructions en langage naturel pour orienter le rendu, ce que Qwen3-TTS-Flash ne fait pas.

Points forts

  • Fonctionne avec des voix clonées à partir d'un enregistrement ou des voix conçues à partir d'une description écrite.
  • Accepte des instructions pour contrôler le ton et le style d'élocution.
  • Parle mandarin, cantonais et de nombreux dialectes régionaux chinois ainsi qu'anglais, français, allemand, japonais, coréen, russe, portugais, thaï, indonésien et vietnamien.
  • Diffuse l'audio via WebSocket, de sorte que la lecture peut commencer avant la fin de la synthèse.

Quand préférer un autre modèle

  • Il n'a pas de voix système intégrées ; vous devez d'abord créer une voix clonée ou conçue.
  • Il nécessite un client WebSocket plutôt qu'une simple requête HTTP.
  • Le clonage vocal nécessite un échantillon de référence propre et le consentement pour utiliser cette voix.

Pour commencer

  1. Créer une clé API

    Générez une clé dans Console et utilisez-la avec tous les modèles de la plateforme.

  2. Envoyez votre première requête

    Copiez l'exemple pour votre langage et lancez-le.

    Texte vers paroleEndpoint TokenLab
    POST/v1/audio/speech
    curl -X POST "https://api.tokenlab.sh/v1/audio/speech" \
      -H "Authorization: Bearer sk-xxx" \
      -H "Content-Type: application/json" \
      -d '{
      "operation": "tts",
      "response_format": "mp3",
      "speed": 1,
      "model": "cosyvoice-v3.5-plus",
      "input": "Hello from TokenLab.",
      "voice": "alloy"
    }'

Tarification

Le tarif officiel est la référence publique du créateur du modèle. Le tarif TokenLab est ce que vous payez pour ce modèle sur TokenLab.

Cosy Tts Number

Par million de caractères
Tarif Official
Entrée $22.06 / Sortie $0.00
Official
Entrée $22.06 / Sortie $0.00
Remise
—

Utilisation et activité

Le taux de réussite est la part de requêtes abouties. La latence est la durée d'une réponse complète ; P95 signifie que 95 % des requêtes ont fini dans ce délai.

Utilisation et disponibilité

Dernières 24 heures
Requêtes
Taux de succès
Latence P95
Total des jetons
Performance du modèle
Les métriques s'affichent une fois les seuils de confidentialité et de volume de données atteints.

Les données sont basées sur les requêtes agrégées des utilisateurs, à l'exclusion des vérifications de statut.

Ouvrir dans Console

Ouvrez CosyVoice v3.5 Plus dans Console avec un prompt prêt à modifier ou envoyer.

Aide-moi à tester cosyvoice-v3.5-plus avec une requête audio sur /v1/audio/speech. Affiche le résultat et le coût.

Cas d'usage

  • Voix de marque

    Clonez un locuteur approuvé une fois et utilisez la voix pour des présentations de produits, des invites IVR et des annonces.

  • Voix de personnages

    Concevez une voix à partir d'une description, comme celle d'un conteur âgé et chaleureux, pour des livres audio ou des jeux.

  • Narration en dialecte régional

    Produisez du contenu parlé en dialecte du Sichuan, de Shanghai ou en cantonais pour des publics locaux.

Exemples de prompts

Lisez cette annonce sur un ton vif et enjoué, avec une courte pause après la date.

Prononcez le paragraphe suivant lentement et chaleureusement, comme si vous lisiez une histoire pour dormir.

Dites ceci en cantonais avec un débit détendu et conversationnel.

FAQ

CosyVoice v3.5 Plus possède-t-il des voix prédéfinies ?

Non. Alibaba ne liste aucune voix système pour ce modèle. Vous avez besoin d'une voix clonée à partir d'un échantillon ou d'une voix conçue à partir d'une description textuelle, puis vous transmettez cette voix lors de la synthèse.

Quelles langues et quels dialectes prend-il en charge ?

Mandarin, cantonais et de nombreux dialectes régionaux chinois, ainsi qu'anglais, français, allemand, japonais, coréen, russe, portugais, thaï, indonésien et vietnamien. La prise en charge des dialectes est une différence majeure par rapport aux modèles Qwen3-TTS-Flash.

Puis-je contrôler la sonorité ?

Oui. Le modèle prend en charge le contrôle par instruction, vous pouvez donc décrire le ton, l'émotion ou le rythme en langage naturel. Le choix de la voix définit qui parle ; l'instruction façonne la manière dont la phrase est délivrée.

Comment est-il appelé ?

Via une API WebSocket qui diffuse l'audio au fur et à mesure de sa génération. Cela convient aux longs scripts et à la lecture en direct, mais vous aurez besoin d'un client qui gère la connexion.

Quand devrais-je choisir Qwen3-TTS-Flash à la place ?

Lorsque vous souhaitez des voix prêtes à l'emploi et un simple appel HTTP et que vous n'avez pas besoin de clonage ou d'instructions. Choisissez CosyVoice lorsque l'identité vocale ou le style de rendu fait partie intégrante de votre produit.

Combien coûte CosyVoice v3.5 Plus ?

Sur TokenLab, CosyVoice v3.5 Plus coûte Entrée $22.06 / Sortie $0.00 Par million de caractères. La table tarifaire ci-dessus en montre le détail complet. Les tarifs dépendent de l’unité de facturation, de la spécification et de l’usage. Comparez des conditions identiques dans la tarification détaillée du modèle ; un tarif seul ne détermine pas le coût total.

Quel endpoint CosyVoice v3.5 Plus doit-il utiliser ?

Utilisez https://api.tokenlab.sh/v1/audio/speech pour CosyVoice v3.5 Plus. L'exemple de requête ci-dessous montre la structure de code correspondante.

Quelles opérations CosyVoice v3.5 Plus prend-il en charge ?

CosyVoice v3.5 Plus prend en charge Texte vers parole. Sélectionnez une opération pour voir l'endpoint et un exemple.

Comparer CosyVoice v3.5 Plus

Sources

Mis à jour le 2 oct. 2026

Modèles associés