Alibaba: Qwen3-TTS 1.7B VoiceDesign
qwen3-tts-1-7b-voicedesign- Prix
- À partir de $0.000015
- Modalités
- Audio
À propos de Qwen3-TTS 1.7B VoiceDesign
Qwen3-TTS 1.7B VoiceDesign est la variante de synthèse vocale d'Alibaba qui crée une voix à partir d'une description écrite plutôt que d'une liste prédéfinie. Vous décrivez l'émotion, le ton et la prosodie en langage naturel, et le modèle prononce le texte avec cette voix. Il couvre dix langues et est destiné aux cas où aucun locuteur existant ne correspond au personnage ou à la marque que vous avez en tête.
Points forts
- Une voix est définie par une description, telle qu'un narrateur âgé avec une élocution lente et chaleureuse, plutôt que choisie dans une liste fixe.
- Le timbre, l'émotion et la prosodie peuvent tous être orientés par instruction, y compris pour des humeurs fortes comme la colère.
- Dix langues sont couvertes : chinois, anglais, japonais, coréen, allemand, français, russe, portugais, espagnol et italien, ainsi que des variantes dialectales.
- Alibaba indique une faible latence de synthèse d'environ 97 ms pour la famille Qwen3-TTS, ce qui convient à un usage interactif.
Quand préférer un autre modèle
- La même description peut produire des voix légèrement différentes lors d'appels distincts ; c'est donc un choix moins judicieux lorsqu'une voix identique doit être répétée pendant des mois.
- Si vous souhaitez un locuteur nommé fixe, la variante CustomVoice avec neuf préréglages est plus prévisible.
- La qualité dépend de la clarté de votre description de la voix ; des descriptions vagues donnent des résultats génériques.
Pour commencer
Créer une clé API
Générez une clé dans Console et utilisez-la avec tous les modèles de la plateforme.
Envoyez votre première requête
Copiez l'exemple pour votre langage et lancez-le.
Texte vers paroleEndpoint TokenLabPOST/v1/audio/speechcurl -X POST "https://api.tokenlab.sh/v1/audio/speech" \ -H "Authorization: Bearer sk-xxx" \ -H "Content-Type: application/json" \ -d '{ "operation": "tts", "model": "qwen3-tts-1-7b-voicedesign", "input": "Hello from TokenLab.", "voice": "alloy" }'
Tarification
Le tarif officiel est la référence publique du créateur du modèle. Le tarif TokenLab est ce que vous payez pour ce modèle sur TokenLab.
Texte vers parole
Par million de caractères- Tarif Official
- $0.000015
- Official
- $0.000015
- Remise
- —
| Tarif OfficialPar million de caractères | OfficialPar million de caractères | Remise | |
|---|---|---|---|
| Texte vers parole | $0.000015 | $0.000015 | — |
Utilisation et activité
Le taux de réussite est la part de requêtes abouties. La latence est la durée d'une réponse complète ; P95 signifie que 95 % des requêtes ont fini dans ce délai.
Utilisation et disponibilité
Dernières 24 heures- Requêtes
- Taux de succès
- Latence P95
- Total des jetons
Les données sont basées sur les requêtes agrégées des utilisateurs, à l'exclusion des vérifications de statut.
Ouvrir dans Console
Ouvrez Qwen3-TTS 1.7B VoiceDesign dans Console avec un prompt prêt à modifier ou envoyer.
Aide-moi à tester qwen3-tts-1-7b-voicedesign avec une requête audio sur /v1/audio/speech. Affiche le résultat et le coût.
Cas d'usage
Voix de personnages pour les jeux
Décrivez chaque personnage, par exemple un nain forgeron bourru ou un jeune coursier nerveux, et générez des répliques sans avoir à recruter un acteur vocal au préalable.
Exploration de la voix de marque
Essayez plusieurs descriptions d'une voix d'entreprise, comme « confiante et grave » versus « vive et rapide », et comparez-les sur le même script.
Narration expressive
Dirigez l'élocution pour des sections narratives avec des instructions comme « étouffé et tendu », puis « soulagé et chaleureux », au sein d'un même projet.
Prototypage de voix pour la vidéo
Créez un narrateur temporaire pour un storyboard ou une vidéo explicative avant que la voix finale ne soit choisie.
Exemples de prompts
Voix : une femme d'âge mûr, calme et grave, parlant lentement comme un narrateur de documentaire. Texte : The river has changed course three times in the last century.
Voix : un jeune homme, enthousiaste et légèrement essoufflé, débit rapide. Texte : You will not believe what just came through the door.
Voix : parler sur un ton particulièrement colérique, rapide et saccadé (用特别愤怒的语气说). Texte : 这已经是第三次了,你们到底有没有在听?
FAQ
À quoi sert Qwen3-TTS VoiceDesign ?
Il génère de la parole avec une voix que vous spécifiez par des mots. Au lieu de sélectionner un locuteur nommé, vous rédigez une description couvrant l'émotion, le ton et l'élocution, et le modèle produit un audio qui suit ces consignes. Il convient aux personnages et aux voix de marque qui ne correspondent pas à un préréglage standard.
En quoi est-ce différent de CustomVoice ?
CustomVoice propose neuf locuteurs nommés fixes avec des instructions de style optionnelles. VoiceDesign n'a pas de liste fixe et construit la voix à partir de votre description. Choisissez VoiceDesign pour créer quelque chose de nouveau et CustomVoice pour un locuteur stable et reproductible.
Quelles langues sont prises en charge ?
Dix : chinois, anglais, japonais, coréen, allemand, français, russe, portugais, espagnol et italien, ainsi que certaines variantes dialectales. Rédigez la description de la voix dans une langue que le modèle comprend ; l'exemple sur la fiche du modèle utilise le chinois.
Puis-je cloner la voix d'une personne réelle avec ?
La famille Qwen3-TTS décrit le clonage vocal à partir d'un court échantillon, mais cette variante se concentre sur la conception basée sur les instructions. Clonez ou imitez uniquement les voix pour lesquelles vous avez l'autorisation, et vérifiez la sortie par rapport à vos propres règles de consentement.
La voix sera-t-elle identique à chaque appel ?
Ce n'est pas garanti. Une description oriente la voix mais ne fixe pas un timbre exact ; des appels répétés peuvent donc sonner légèrement différemment. Si vous avez besoin d'une répétition exacte sur un long projet, utilisez plutôt un locuteur prédéfini fixe.
Combien coûte Qwen3-TTS 1.7B VoiceDesign ?
Sur TokenLab, Qwen3-TTS 1.7B VoiceDesign coûte - . La table tarifaire ci-dessus en montre le détail complet. Les tarifs dépendent de l’unité de facturation, de la spécification et de l’usage. Comparez des conditions identiques dans la tarification détaillée du modèle ; un tarif seul ne détermine pas le coût total.
Quel endpoint Qwen3-TTS 1.7B VoiceDesign doit-il utiliser ?
Utilisez https://api.tokenlab.sh/v1/audio/speech pour Qwen3-TTS 1.7B VoiceDesign. L'exemple de requête ci-dessous montre la structure de code correspondante.
Quelles opérations Qwen3-TTS 1.7B VoiceDesign prend-il en charge ?
Qwen3-TTS 1.7B VoiceDesign prend en charge Texte vers parole. Sélectionnez une opération pour voir l'endpoint et un exemple.
Comparer Qwen3-TTS 1.7B VoiceDesign
Sources
Mis à jour le 2 oct. 2026