Alibaba: Qwen3-TTS 1.7B VoiceDesign
qwen3-tts-1-7b-voicedesign- Precio
- Desde $0.000015
- Modalidades
- Audio
Sobre Qwen3-TTS 1.7B VoiceDesign
Qwen3-TTS 1.7B VoiceDesign es la variante de texto a voz de Alibaba que crea una voz a partir de una descripción escrita en lugar de una lista preestablecida. Usted describe la emoción, el tono y la prosodia en lenguaje natural, y el modelo pronuncia el texto con esa voz. Cubre diez idiomas y está pensado para casos en los que ningún locutor existente se ajusta al personaje o la marca que usted tiene en mente.
Puntos fuertes
- Una voz se define mediante una descripción, como "un narrador de edad avanzada con una entrega lenta y cálida", en lugar de elegirse de una lista fija.
- El timbre, la emoción y la prosodia pueden ser dirigidos mediante instrucciones, incluyendo estados de ánimo intensos como el enfado.
- Se cubren diez idiomas: chino, inglés, japonés, coreano, alemán, francés, ruso, portugués, español e italiano, además de variantes dialectales.
- Alibaba enumera una baja latencia de síntesis de unos 97 ms para la familia Qwen3-TTS, por lo que se adapta al uso interactivo.
Cuándo buscar otra opción
- La misma descripción puede producir voces ligeramente diferentes en llamadas distintas, por lo que es una opción menos adecuada cuando una voz exacta debe repetirse durante meses.
- Si desea un locutor fijo con nombre, la variante CustomVoice con nueve preajustes es más predecible.
- La calidad depende de la claridad con la que describa la voz; las descripciones vagas dan resultados genéricos.
Primeros pasos
Crear clave API
Genera una clave en Console y úsala con cualquier modelo de la plataforma.
Envía tu primera solicitud
Copia el ejemplo para tu lenguaje y ejecútalo contra el endpoint.
Texto a vozEndpoint de TokenLabPOST/v1/audio/speechcurl -X POST "https://api.tokenlab.sh/v1/audio/speech" \ -H "Authorization: Bearer sk-xxx" \ -H "Content-Type: application/json" \ -d '{ "operation": "tts", "model": "qwen3-tts-1-7b-voicedesign", "input": "Hello from TokenLab.", "voice": "alloy" }'
Precios
El precio oficial es la línea base pública del creador del modelo. El precio de TokenLab es lo que pagas por este modelo en TokenLab.
Texto a voz
Por millón de caracteres- Precio Official
- $0.000015
- Official
- $0.000015
- Descuento
- —
| Precio OfficialPor millón de caracteres | OfficialPor millón de caracteres | Descuento | |
|---|---|---|---|
| Texto a voz | $0.000015 | $0.000015 | — |
Uso y actividad
La tasa de éxito es la proporción de solicitudes completadas. La latencia es cuánto tarda una respuesta completa; P95 significa que el 95 % de las solicitudes terminaron dentro de ese tiempo.
Uso y disponibilidad
Últimas 24 horas- Solicitudes
- Tasa de éxito
- Latencia P95
- Total de tokens
Los datos se basan en solicitudes de usuario agregadas, excluyendo las comprobaciones de estado.
Abrir en Console
Abre Qwen3-TTS 1.7B VoiceDesign en Console con un prompt listo para editar o enviar.
Ayúdame a probar qwen3-tts-1-7b-voicedesign con una solicitud de audio breve en /v1/audio/speech. Muestra el resultado y el coste.
Casos de uso
Voces de personajes para juegos
Describa a cada personaje, por ejemplo, un herrero enano brusco o un joven mensajero nervioso, y genere líneas sin necesidad de contratar a un actor de voz primero.
Exploración de la voz de marca
Pruebe varias descripciones de una voz corporativa, como "segura y grave" frente a "brillante y rápida", y compárelas con el mismo guion.
Narración expresiva
Dirija la entrega para secciones de historias con instrucciones como "en voz baja y tensa", y luego "aliviado y cálido", dentro de un mismo proyecto.
Prototipos de voces para vídeo
Cree un narrador temporal para un guion gráfico o vídeo explicativo antes de elegir la voz definitiva.
Ejemplos de prompts
Voz: una mujer de mediana edad, tranquila y grave, que habla lentamente como un narrador de documentales. Texto: The river has changed course three times in the last century.
Voz: un hombre joven, emocionado y ligeramente sin aliento, ritmo rápido. Texto: You will not believe what just came through the door.
Voz: hablar en un tono especialmente enfadado, rápido y cortante (用特别愤怒的语气说). Texto: 这已经是第三次了,你们到底有没有在听?
FAQ
¿Para qué sirve Qwen3-TTS VoiceDesign?
Genera voz con una voz que usted especifica con palabras. En lugar de seleccionar un locutor con nombre, usted escribe una descripción que cubre la emoción, el tono y la entrega, y el modelo produce audio que sigue esas indicaciones. Se adapta a personajes y voces de marca que no coinciden con un preajuste estándar.
¿En qué se diferencia de CustomVoice?
CustomVoice ofrece nueve locutores fijos con nombre con instrucciones de estilo opcionales. VoiceDesign no tiene una lista fija y construye la voz a partir de su descripción. Elija VoiceDesign para crear algo nuevo y CustomVoice para un locutor estable y repetible.
¿Qué idiomas son compatibles?
Diez: chino, inglés, japonés, coreano, alemán, francés, ruso, portugués, español e italiano, junto con algunas variantes dialectales. Escriba la descripción de la voz en un idioma que el modelo entienda; el ejemplo en la tarjeta del modelo utiliza chino.
¿Puedo clonar la voz de una persona real con esto?
La familia Qwen3-TTS describe la clonación de voz a partir de una muestra corta, pero el enfoque de esta variante es el diseño basado en instrucciones. Solo clone o imite voces que tenga permiso para usar, y verifique la salida con sus propias reglas de consentimiento.
¿La voz será idéntica en cada llamada?
No está garantizado. Una descripción dirige la voz pero no fija un timbre exacto, por lo que las llamadas repetidas pueden sonar ligeramente diferentes. Si necesita una repetición exacta a lo largo de un proyecto largo, utilice un locutor preestablecido fijo en su lugar.
¿Cuánto cuesta Qwen3-TTS 1.7B VoiceDesign?
En TokenLab, Qwen3-TTS 1.7B VoiceDesign cuesta - . La tabla de precios arriba muestra el desglose completo. Las tarifas dependen de la unidad de facturación, la especificación y el uso. Compare condiciones iguales en el precio detallado del modelo; una sola tarifa no determina el coste total.
¿Qué endpoint debe usar Qwen3-TTS 1.7B VoiceDesign?
Utiliza https://api.tokenlab.sh/v1/audio/speech para Qwen3-TTS 1.7B VoiceDesign. El ejemplo de solicitud a continuación muestra la estructura de código correspondiente.
¿Qué operaciones soporta Qwen3-TTS 1.7B VoiceDesign?
Qwen3-TTS 1.7B VoiceDesign admite Texto a voz. Selecciona una operación arriba para ver su endpoint y ejemplo de solicitud.
Comparar Qwen3-TTS 1.7B VoiceDesign
Fuentes
Revisado el 2 oct 2026