Elija Auto, TokenLab Verified o Official para cada solicitud, con los precios mostrados por adelantado.Ver las novedades

Alibaba: Qwen3-TTS 1.7B VoiceDesign

Qwen3-TTS 1.7B VoiceDesign es un modelo de texto a voz de Alibaba que crea voces personalizadas a partir de descripciones en lenguaje natural que especifican la emoción, el tono y la prosodia. Admite la clonación de voz a partir de una muestra de audio de 3 segundos, genera voz en más de 10 idiomas, incluidos chino, inglés, japonés, coreano y lenguas europeas, y logra una latencia de hasta 97 ms.
Comparar modelos
qwen3-tts-1-7b-voicedesign
DisponibleAlibabaTexto a vozSíncrono
Precio
Desde $0.000015
Modalidades
Audio

Sobre Qwen3-TTS 1.7B VoiceDesign

Qwen3-TTS 1.7B VoiceDesign es la variante de texto a voz de Alibaba que crea una voz a partir de una descripción escrita en lugar de una lista preestablecida. Usted describe la emoción, el tono y la prosodia en lenguaje natural, y el modelo pronuncia el texto con esa voz. Cubre diez idiomas y está pensado para casos en los que ningún locutor existente se ajusta al personaje o la marca que usted tiene en mente.

Puntos fuertes

  • Una voz se define mediante una descripción, como "un narrador de edad avanzada con una entrega lenta y cálida", en lugar de elegirse de una lista fija.
  • El timbre, la emoción y la prosodia pueden ser dirigidos mediante instrucciones, incluyendo estados de ánimo intensos como el enfado.
  • Se cubren diez idiomas: chino, inglés, japonés, coreano, alemán, francés, ruso, portugués, español e italiano, además de variantes dialectales.
  • Alibaba enumera una baja latencia de síntesis de unos 97 ms para la familia Qwen3-TTS, por lo que se adapta al uso interactivo.

Cuándo buscar otra opción

  • La misma descripción puede producir voces ligeramente diferentes en llamadas distintas, por lo que es una opción menos adecuada cuando una voz exacta debe repetirse durante meses.
  • Si desea un locutor fijo con nombre, la variante CustomVoice con nueve preajustes es más predecible.
  • La calidad depende de la claridad con la que describa la voz; las descripciones vagas dan resultados genéricos.

Primeros pasos

  1. Crear clave API

    Genera una clave en Console y úsala con cualquier modelo de la plataforma.

  2. Envía tu primera solicitud

    Copia el ejemplo para tu lenguaje y ejecútalo contra el endpoint.

    Texto a vozEndpoint de TokenLab
    POST/v1/audio/speech
    curl -X POST "https://api.tokenlab.sh/v1/audio/speech" \
      -H "Authorization: Bearer sk-xxx" \
      -H "Content-Type: application/json" \
      -d '{
      "operation": "tts",
      "model": "qwen3-tts-1-7b-voicedesign",
      "input": "Hello from TokenLab.",
      "voice": "alloy"
    }'

Precios

El precio oficial es la línea base pública del creador del modelo. El precio de TokenLab es lo que pagas por este modelo en TokenLab.

Texto a voz

Por millón de caracteres
Precio Official
$0.000015
Official
$0.000015
Descuento
—

Uso y actividad

La tasa de éxito es la proporción de solicitudes completadas. La latencia es cuánto tarda una respuesta completa; P95 significa que el 95 % de las solicitudes terminaron dentro de ese tiempo.

Uso y disponibilidad

Últimas 24 horas
Solicitudes
Tasa de éxito
Latencia P95
Total de tokens
Desempeño del modelo
Las métricas aparecerán una vez que se alcancen los umbrales de privacidad y volumen de datos.

Los datos se basan en solicitudes de usuario agregadas, excluyendo las comprobaciones de estado.

Abrir en Console

Abre Qwen3-TTS 1.7B VoiceDesign en Console con un prompt listo para editar o enviar.

Ayúdame a probar qwen3-tts-1-7b-voicedesign con una solicitud de audio breve en /v1/audio/speech. Muestra el resultado y el coste.

Casos de uso

  • Voces de personajes para juegos

    Describa a cada personaje, por ejemplo, un herrero enano brusco o un joven mensajero nervioso, y genere líneas sin necesidad de contratar a un actor de voz primero.

  • Exploración de la voz de marca

    Pruebe varias descripciones de una voz corporativa, como "segura y grave" frente a "brillante y rápida", y compárelas con el mismo guion.

  • Narración expresiva

    Dirija la entrega para secciones de historias con instrucciones como "en voz baja y tensa", y luego "aliviado y cálido", dentro de un mismo proyecto.

  • Prototipos de voces para vídeo

    Cree un narrador temporal para un guion gráfico o vídeo explicativo antes de elegir la voz definitiva.

Ejemplos de prompts

Voz: una mujer de mediana edad, tranquila y grave, que habla lentamente como un narrador de documentales. Texto: The river has changed course three times in the last century.

Voz: un hombre joven, emocionado y ligeramente sin aliento, ritmo rápido. Texto: You will not believe what just came through the door.

Voz: hablar en un tono especialmente enfadado, rápido y cortante (用特别愤怒的语气说). Texto: 这已经是第三次了,你们到底有没有在听?

FAQ

¿Para qué sirve Qwen3-TTS VoiceDesign?

Genera voz con una voz que usted especifica con palabras. En lugar de seleccionar un locutor con nombre, usted escribe una descripción que cubre la emoción, el tono y la entrega, y el modelo produce audio que sigue esas indicaciones. Se adapta a personajes y voces de marca que no coinciden con un preajuste estándar.

¿En qué se diferencia de CustomVoice?

CustomVoice ofrece nueve locutores fijos con nombre con instrucciones de estilo opcionales. VoiceDesign no tiene una lista fija y construye la voz a partir de su descripción. Elija VoiceDesign para crear algo nuevo y CustomVoice para un locutor estable y repetible.

¿Qué idiomas son compatibles?

Diez: chino, inglés, japonés, coreano, alemán, francés, ruso, portugués, español e italiano, junto con algunas variantes dialectales. Escriba la descripción de la voz en un idioma que el modelo entienda; el ejemplo en la tarjeta del modelo utiliza chino.

¿Puedo clonar la voz de una persona real con esto?

La familia Qwen3-TTS describe la clonación de voz a partir de una muestra corta, pero el enfoque de esta variante es el diseño basado en instrucciones. Solo clone o imite voces que tenga permiso para usar, y verifique la salida con sus propias reglas de consentimiento.

¿La voz será idéntica en cada llamada?

No está garantizado. Una descripción dirige la voz pero no fija un timbre exacto, por lo que las llamadas repetidas pueden sonar ligeramente diferentes. Si necesita una repetición exacta a lo largo de un proyecto largo, utilice un locutor preestablecido fijo en su lugar.

¿Cuánto cuesta Qwen3-TTS 1.7B VoiceDesign?

En TokenLab, Qwen3-TTS 1.7B VoiceDesign cuesta - . La tabla de precios arriba muestra el desglose completo. Las tarifas dependen de la unidad de facturación, la especificación y el uso. Compare condiciones iguales en el precio detallado del modelo; una sola tarifa no determina el coste total.

¿Qué endpoint debe usar Qwen3-TTS 1.7B VoiceDesign?

Utiliza https://api.tokenlab.sh/v1/audio/speech para Qwen3-TTS 1.7B VoiceDesign. El ejemplo de solicitud a continuación muestra la estructura de código correspondiente.

¿Qué operaciones soporta Qwen3-TTS 1.7B VoiceDesign?

Qwen3-TTS 1.7B VoiceDesign admite Texto a voz. Selecciona una operación arriba para ver su endpoint y ejemplo de solicitud.

Comparar Qwen3-TTS 1.7B VoiceDesign

Fuentes

Revisado el 2 oct 2026

Más de Qwen TTS

Modelos relacionados