Choisissez Auto, TokenLab Verified ou Official pour chaque demande, avec les prix affichés à l'avance.Voir les nouveautés

Alibaba: Qwen3-TTS 1.7B VoiceDesign

Qwen3-TTS 1.7B VoiceDesign est un modèle de synthèse vocale d'Alibaba qui crée des voix personnalisées à partir de descriptions en langage naturel spécifiant l'émotion, le ton et la prosodie. Il prend en charge le clonage vocal à partir d'un échantillon audio de 3 secondes, génère de la parole dans plus de 10 langues, dont le chinois, l'anglais, le japonais, le coréen et les langues européennes, et atteint une latence aussi faible que 97 ms.
Comparer les modèles
qwen3-tts-1-7b-voicedesign
DisponibleAlibabaTexte vers paroleSynchrone
Prix
À partir de $0.000015
Modalités
Audio

À propos de Qwen3-TTS 1.7B VoiceDesign

Qwen3-TTS 1.7B VoiceDesign est la variante de synthèse vocale d'Alibaba qui crée une voix à partir d'une description écrite plutôt que d'une liste prédéfinie. Vous décrivez l'émotion, le ton et la prosodie en langage naturel, et le modèle prononce le texte avec cette voix. Il couvre dix langues et est destiné aux cas où aucun locuteur existant ne correspond au personnage ou à la marque que vous avez en tête.

Points forts

  • Une voix est définie par une description, telle qu'un narrateur âgé avec une élocution lente et chaleureuse, plutôt que choisie dans une liste fixe.
  • Le timbre, l'émotion et la prosodie peuvent tous être orientés par instruction, y compris pour des humeurs fortes comme la colère.
  • Dix langues sont couvertes : chinois, anglais, japonais, coréen, allemand, français, russe, portugais, espagnol et italien, ainsi que des variantes dialectales.
  • Alibaba indique une faible latence de synthèse d'environ 97 ms pour la famille Qwen3-TTS, ce qui convient à un usage interactif.

Quand préférer un autre modèle

  • La même description peut produire des voix légèrement différentes lors d'appels distincts ; c'est donc un choix moins judicieux lorsqu'une voix identique doit être répétée pendant des mois.
  • Si vous souhaitez un locuteur nommé fixe, la variante CustomVoice avec neuf préréglages est plus prévisible.
  • La qualité dépend de la clarté de votre description de la voix ; des descriptions vagues donnent des résultats génériques.

Pour commencer

  1. Créer une clé API

    Générez une clé dans Console et utilisez-la avec tous les modèles de la plateforme.

  2. Envoyez votre première requête

    Copiez l'exemple pour votre langage et lancez-le.

    Texte vers paroleEndpoint TokenLab
    POST/v1/audio/speech
    curl -X POST "https://api.tokenlab.sh/v1/audio/speech" \
      -H "Authorization: Bearer sk-xxx" \
      -H "Content-Type: application/json" \
      -d '{
      "operation": "tts",
      "model": "qwen3-tts-1-7b-voicedesign",
      "input": "Hello from TokenLab.",
      "voice": "alloy"
    }'

Tarification

Le tarif officiel est la référence publique du créateur du modèle. Le tarif TokenLab est ce que vous payez pour ce modèle sur TokenLab.

Texte vers parole

Par million de caractères
Tarif Official
$0.000015
Official
$0.000015
Remise
—

Utilisation et activité

Le taux de réussite est la part de requêtes abouties. La latence est la durée d'une réponse complète ; P95 signifie que 95 % des requêtes ont fini dans ce délai.

Utilisation et disponibilité

Dernières 24 heures
Requêtes
Taux de succès
Latence P95
Total des jetons
Performance du modèle
Les métriques s'affichent une fois les seuils de confidentialité et de volume de données atteints.

Les données sont basées sur les requêtes agrégées des utilisateurs, à l'exclusion des vérifications de statut.

Ouvrir dans Console

Ouvrez Qwen3-TTS 1.7B VoiceDesign dans Console avec un prompt prêt à modifier ou envoyer.

Aide-moi à tester qwen3-tts-1-7b-voicedesign avec une requête audio sur /v1/audio/speech. Affiche le résultat et le coût.

Cas d'usage

  • Voix de personnages pour les jeux

    Décrivez chaque personnage, par exemple un nain forgeron bourru ou un jeune coursier nerveux, et générez des répliques sans avoir à recruter un acteur vocal au préalable.

  • Exploration de la voix de marque

    Essayez plusieurs descriptions d'une voix d'entreprise, comme « confiante et grave » versus « vive et rapide », et comparez-les sur le même script.

  • Narration expressive

    Dirigez l'élocution pour des sections narratives avec des instructions comme « étouffé et tendu », puis « soulagé et chaleureux », au sein d'un même projet.

  • Prototypage de voix pour la vidéo

    Créez un narrateur temporaire pour un storyboard ou une vidéo explicative avant que la voix finale ne soit choisie.

Exemples de prompts

Voix : une femme d'âge mûr, calme et grave, parlant lentement comme un narrateur de documentaire. Texte : The river has changed course three times in the last century.

Voix : un jeune homme, enthousiaste et légèrement essoufflé, débit rapide. Texte : You will not believe what just came through the door.

Voix : parler sur un ton particulièrement colérique, rapide et saccadé (用特别愤怒的语气说). Texte : 这已经是第三次了,你们到底有没有在听?

FAQ

À quoi sert Qwen3-TTS VoiceDesign ?

Il génère de la parole avec une voix que vous spécifiez par des mots. Au lieu de sélectionner un locuteur nommé, vous rédigez une description couvrant l'émotion, le ton et l'élocution, et le modèle produit un audio qui suit ces consignes. Il convient aux personnages et aux voix de marque qui ne correspondent pas à un préréglage standard.

En quoi est-ce différent de CustomVoice ?

CustomVoice propose neuf locuteurs nommés fixes avec des instructions de style optionnelles. VoiceDesign n'a pas de liste fixe et construit la voix à partir de votre description. Choisissez VoiceDesign pour créer quelque chose de nouveau et CustomVoice pour un locuteur stable et reproductible.

Quelles langues sont prises en charge ?

Dix : chinois, anglais, japonais, coréen, allemand, français, russe, portugais, espagnol et italien, ainsi que certaines variantes dialectales. Rédigez la description de la voix dans une langue que le modèle comprend ; l'exemple sur la fiche du modèle utilise le chinois.

Puis-je cloner la voix d'une personne réelle avec ?

La famille Qwen3-TTS décrit le clonage vocal à partir d'un court échantillon, mais cette variante se concentre sur la conception basée sur les instructions. Clonez ou imitez uniquement les voix pour lesquelles vous avez l'autorisation, et vérifiez la sortie par rapport à vos propres règles de consentement.

La voix sera-t-elle identique à chaque appel ?

Ce n'est pas garanti. Une description oriente la voix mais ne fixe pas un timbre exact ; des appels répétés peuvent donc sonner légèrement différemment. Si vous avez besoin d'une répétition exacte sur un long projet, utilisez plutôt un locuteur prédéfini fixe.

Combien coûte Qwen3-TTS 1.7B VoiceDesign ?

Sur TokenLab, Qwen3-TTS 1.7B VoiceDesign coûte - . La table tarifaire ci-dessus en montre le détail complet. Les tarifs dépendent de l’unité de facturation, de la spécification et de l’usage. Comparez des conditions identiques dans la tarification détaillée du modèle ; un tarif seul ne détermine pas le coût total.

Quel endpoint Qwen3-TTS 1.7B VoiceDesign doit-il utiliser ?

Utilisez https://api.tokenlab.sh/v1/audio/speech pour Qwen3-TTS 1.7B VoiceDesign. L'exemple de requête ci-dessous montre la structure de code correspondante.

Quelles opérations Qwen3-TTS 1.7B VoiceDesign prend-il en charge ?

Qwen3-TTS 1.7B VoiceDesign prend en charge Texte vers parole. Sélectionnez une opération pour voir l'endpoint et un exemple.

Comparer Qwen3-TTS 1.7B VoiceDesign

Sources

Mis à jour le 2 oct. 2026

Plus de la série Qwen TTS

Modèles associés