Choisissez Auto, TokenLab Verified ou Official pour chaque demande, avec les prix affichés à l'avance.Voir les nouveautés

Alibaba: Qwen3-TTS 1.7B CustomVoice

Qwen3-TTS 1.7B CustomVoice est un modèle de synthèse vocale d'Alibaba qui propose neuf timbres prédéfinis haut de gamme à travers diverses combinaisons de genre, d'âge, de langue et de dialecte. Il offre un contrôle précis du style sur les voix cibles via des instructions utilisateur, prend en charge le clonage vocal à partir d'un échantillon de 3 secondes et génère de la parole dans plus de 10 langues avec une latence aussi faible que 97 ms.
Comparer les modèles
qwen3-tts-1-7b-customvoice
DisponibleAlibabaTexte vers paroleSynchrone
Prix
À partir de $0.000015
Modalités
Audio

À propos de Qwen3-TTS 1.7B CustomVoice

Qwen3-TTS 1.7B CustomVoice est le modèle de synthèse vocale d'Alibaba conçu autour d'un ensemble fixe de neuf voix prédéfinies. Vous choisissez un locuteur par son nom et pouvez ajouter une instruction en langage naturel concernant le ton, l'émotion ou le style d'élocution. Il parle dix langues, dont le chinois, l'anglais, le japonais, le coréen et plusieurs langues européennes, et Alibaba indique une latence de synthèse de bout en bout aussi basse que 97 ms pour un usage interactif.

Points forts

  • Neuf locuteurs premium nommés couvrent différents genres, âges, langues et dialectes, permettant ainsi à une voix de rester identique tout au long d'un produit.
  • Une instruction écrite peut orienter l'émotion et la manière de parler sans changer le locuteur choisi.
  • Dix langues sont prises en charge : chinois, anglais, japonais, coréen, allemand, français, russe, portugais, espagnol et italien.
  • Alibaba rapporte une latence de bout en bout aussi basse que 97 ms, ce qui convient aux assistants vocaux et à la narration en direct.

Quand préférer un autre modèle

  • La liste des voix est fixe ; pour inventer une nouvelle voix à partir d'une description, la variante VoiceDesign est plus adaptée.
  • Les résultats sont optimaux lorsqu'un locuteur lit sa propre langue maternelle ; ainsi, une voix anglaise prédéfinie lisant du japonais peut avoir un accent.
  • Un texte d'entrée bruyant ou inhabituel, tel qu'un balisage lourd ou des symboles mixtes, peut réduire la qualité de la sortie.

Pour commencer

  1. Créer une clé API

    Générez une clé dans Console et utilisez-la avec tous les modèles de la plateforme.

  2. Envoyez votre première requête

    Copiez l'exemple pour votre langage et lancez-le.

    Texte vers paroleEndpoint TokenLab
    POST/v1/audio/speech
    curl -X POST "https://api.tokenlab.sh/v1/audio/speech" \
      -H "Authorization: Bearer sk-xxx" \
      -H "Content-Type: application/json" \
      -d '{
      "operation": "tts",
      "model": "qwen3-tts-1-7b-customvoice",
      "input": "Hello from TokenLab.",
      "voice": "alloy"
    }'

Tarification

Le tarif officiel est la référence publique du créateur du modèle. Le tarif TokenLab est ce que vous payez pour ce modèle sur TokenLab.

Texte vers parole

Par million de caractères
Tarif Official
$0.000015
Official
$0.000015
Remise
—

Utilisation et activité

Le taux de réussite est la part de requêtes abouties. La latence est la durée d'une réponse complète ; P95 signifie que 95 % des requêtes ont fini dans ce délai.

Utilisation et disponibilité

Dernières 24 heures
Requêtes
Taux de succès
Latence P95
Total des jetons
Performance du modèle
Les métriques s'affichent une fois les seuils de confidentialité et de volume de données atteints.

Les données sont basées sur les requêtes agrégées des utilisateurs, à l'exclusion des vérifications de statut.

Ouvrir dans Console

Ouvrez Qwen3-TTS 1.7B CustomVoice dans Console avec un prompt prêt à modifier ou envoyer.

Aide-moi à tester qwen3-tts-1-7b-customvoice avec une requête audio sur /v1/audio/speech. Affiche le résultat et le coût.

Cas d'usage

  • Assistants vocaux

    Donnez à un assistant intégré une voix nommée stable et un faible délai de réponse afin que les réponses commencent à être lues rapidement une fois le texte prêt.

  • Narration de livres audio et d'articles

    Lisez un long texte avec un locuteur choisi et ajoutez une instruction telle que « calme et chaleureux » pour maintenir une cohérence de ton tout au long des chapitres.

  • Vidéos de produits localisées

    Utilisez les préréglages japonais, coréens ou anglais pour doubler le même script selon le marché, tout en conservant une identité sonore reconnaissable pour la marque.

  • Répliques de jeux et de personnages

    Choisissez des préréglages distincts pour différents personnages et ajoutez des instructions d'émotion pour des répliques colériques, fatiguées ou enthousiastes.

Exemples de prompts

Locuteur : Ryan. Instruction : calme, amical, légèrement lent. Texte : Welcome back. Your order has shipped and should arrive on Thursday.

Locuteur : Ono_Anna. Instruction : annonceuse joyeuse. Texte : 本日はご来店いただき、ありがとうございます。

Locuteur : Vivian. Instruction : chuchotement, comme si elle confiait un secret. Texte : 你听说了吗?明天会有一个大消息。

FAQ

Quelles voix Qwen3-TTS CustomVoice propose-t-il ?

Neuf préréglages : Vivian, Serena, Uncle_Fu, Dylan et Eric pour les variantes chinoises, Ryan et Aiden pour l'anglais, Ono_Anna pour le japonais et Sohee pour le coréen. Vous en choisissez un par son nom pour chaque requête.

Puis-je contrôler l'émotion et le style d'élocution ?

Oui. Vous pouvez ajouter une instruction en langage naturel, par exemple « en colère », « doux » ou « rapide et enthousiaste », et le modèle ajuste le ton et la manière tout en conservant le timbre du locuteur sélectionné.

En quoi CustomVoice diffère-t-il de VoiceDesign ?

CustomVoice utilise neuf locuteurs fixes que vous sélectionnez. VoiceDesign n'a pas de liste prédéfinie ; vous décrivez la voix souhaitée avec des mots, tels que l'âge, l'humeur et la prosodie, et le modèle la crée. Choisissez CustomVoice pour la cohérence et VoiceDesign pour créer de nouvelles voix.

Quelles langues parle-t-il ?

Dix : chinois, anglais, japonais, coréen, allemand, français, russe, portugais, espagnol et italien. La fiche du modèle conseille d'utiliser chaque locuteur dans sa langue maternelle pour une qualité optimale.

Est-ce assez rapide pour une conversation en direct ?

Alibaba indique une latence de synthèse de bout en bout aussi basse que 97 ms, destinée à une utilisation en temps réel. Le délai réel dans votre application dépend également de la distance réseau et de la longueur du texte ; mesurez-le donc avec votre propre trafic.

Combien coûte Qwen3-TTS 1.7B CustomVoice ?

Sur TokenLab, Qwen3-TTS 1.7B CustomVoice coûte - . La table tarifaire ci-dessus en montre le détail complet. Les tarifs dépendent de l’unité de facturation, de la spécification et de l’usage. Comparez des conditions identiques dans la tarification détaillée du modèle ; un tarif seul ne détermine pas le coût total.

Quel endpoint Qwen3-TTS 1.7B CustomVoice doit-il utiliser ?

Utilisez https://api.tokenlab.sh/v1/audio/speech pour Qwen3-TTS 1.7B CustomVoice. L'exemple de requête ci-dessous montre la structure de code correspondante.

Quelles opérations Qwen3-TTS 1.7B CustomVoice prend-il en charge ?

Qwen3-TTS 1.7B CustomVoice prend en charge Texte vers parole. Sélectionnez une opération pour voir l'endpoint et un exemple.

Comparer Qwen3-TTS 1.7B CustomVoice

Sources

Mis à jour le 2 oct. 2026

Plus de la série Qwen TTS

Modèles associés