Elija Auto, TokenLab Verified o Official para cada solicitud, con los precios mostrados por adelantado.Ver las novedades

Alibaba: Qwen3-TTS 1.7B CustomVoice

Qwen3-TTS 1.7B CustomVoice es un modelo de texto a voz de Alibaba que ofrece nueve timbres preestablecidos premium en varias combinaciones de género, edad, idioma y dialecto. Proporciona un control de estilo preciso sobre las voces objetivo a través de instrucciones del usuario, admite la clonación de voz a partir de una muestra de 3 segundos y genera voz en más de 10 idiomas con una latencia de hasta 97 ms.
Comparar modelos
qwen3-tts-1-7b-customvoice
DisponibleAlibabaTexto a vozSíncrono
Precio
Desde $0.000015
Modalidades
Audio

Sobre Qwen3-TTS 1.7B CustomVoice

Qwen3-TTS 1.7B CustomVoice es el modelo de texto a voz de Alibaba construido en torno a un conjunto fijo de nueve voces preestablecidas. Usted elige un locutor por su nombre y puede añadir una instrucción en lenguaje sencillo sobre el tono, la emoción o el estilo de habla. Habla diez idiomas, incluidos chino, inglés, japonés, coreano y varios idiomas europeos, y Alibaba cita una latencia de síntesis de extremo a extremo de tan solo 97 ms para uso interactivo.

Puntos fuertes

  • Nueve locutores premium con nombre cubren diferentes géneros, edades, idiomas y dialectos, por lo que una voz puede mantenerse igual a lo largo de todo un producto.
  • Una instrucción escrita puede dirigir la emoción y la forma de hablar sin cambiar al locutor elegido.
  • Se admiten diez idiomas: chino, inglés, japonés, coreano, alemán, francés, ruso, portugués, español e italiano.
  • Alibaba informa de una latencia de extremo a extremo de tan solo 97 ms, lo cual es adecuado para asistentes de voz y narración en vivo.

Cuándo buscar otra opción

  • La lista de voces es fija; para inventar una nueva voz a partir de una descripción, la variante VoiceDesign es la opción más adecuada.
  • Los resultados son mejores cuando un locutor lee su propio idioma nativo, por lo que un preajuste en inglés leyendo japonés puede sonar con acento.
  • El texto de entrada ruidoso o inusual, como el que contiene un marcado pesado o símbolos mezclados, puede reducir la calidad de la salida.

Primeros pasos

  1. Crear clave API

    Genera una clave en Console y úsala con cualquier modelo de la plataforma.

  2. Envía tu primera solicitud

    Copia el ejemplo para tu lenguaje y ejecútalo contra el endpoint.

    Texto a vozEndpoint de TokenLab
    POST/v1/audio/speech
    curl -X POST "https://api.tokenlab.sh/v1/audio/speech" \
      -H "Authorization: Bearer sk-xxx" \
      -H "Content-Type: application/json" \
      -d '{
      "operation": "tts",
      "model": "qwen3-tts-1-7b-customvoice",
      "input": "Hello from TokenLab.",
      "voice": "alloy"
    }'

Precios

El precio oficial es la línea base pública del creador del modelo. El precio de TokenLab es lo que pagas por este modelo en TokenLab.

Texto a voz

Por millón de caracteres
Precio Official
$0.000015
Official
$0.000015
Descuento
—

Uso y actividad

La tasa de éxito es la proporción de solicitudes completadas. La latencia es cuánto tarda una respuesta completa; P95 significa que el 95 % de las solicitudes terminaron dentro de ese tiempo.

Uso y disponibilidad

Últimas 24 horas
Solicitudes
Tasa de éxito
Latencia P95
Total de tokens
Desempeño del modelo
Las métricas aparecerán una vez que se alcancen los umbrales de privacidad y volumen de datos.

Los datos se basan en solicitudes de usuario agregadas, excluyendo las comprobaciones de estado.

Abrir en Console

Abre Qwen3-TTS 1.7B CustomVoice en Console con un prompt listo para editar o enviar.

Ayúdame a probar qwen3-tts-1-7b-customvoice con una solicitud de audio breve en /v1/audio/speech. Muestra el resultado y el coste.

Casos de uso

  • Asistentes de voz

    Proporcione a un asistente en la aplicación una voz fija con nombre y un bajo retardo de respuesta para que las réplicas comiencen a reproducirse rápidamente una vez que el texto esté listo.

  • Narración de audiolibros y artículos

    Lea textos largos con un locutor elegido y añada una instrucción como "tranquilo y cálido" para mantener la entrega constante a lo largo de los capítulos.

  • Vídeos de productos localizados

    Utilice los preajustes en japonés, coreano o inglés para poner voz al mismo guion según el mercado, mientras la marca mantiene un sonido reconocible.

  • Líneas de juegos y personajes

    Elija preajustes distintos para diferentes personajes y añada instrucciones de emoción para líneas de enfado, cansancio o entusiasmo.

Ejemplos de prompts

Locutor: Ryan. Instrucción: tranquilo, amable, ligeramente lento. Texto: Welcome back. Your order has shipped and should arrive on Thursday.

Locutor: Ono_Anna. Instrucción: locutora alegre. Texto: 本日はご来店いただき、ありがとうございます。

Locutor: Vivian. Instrucción: susurro, como si contara un secreto. Texto: 你听说了吗?明天会有一个大消息。

FAQ

¿Qué voces ofrece Qwen3-TTS CustomVoice?

Nueve preajustes: Vivian, Serena, Uncle_Fu, Dylan y Eric para variantes en chino; Ryan y Aiden para inglés; Ono_Anna para japonés; y Sohee para coreano. Usted elige uno por su nombre para cada solicitud.

¿Puedo controlar la emoción y el estilo de habla?

Sí. Puede añadir una instrucción en lenguaje natural, por ejemplo "enfadado", "suave" o "rápido y emocionado", y el modelo ajusta el tono y la forma mientras mantiene el timbre del locutor seleccionado.

¿En qué se diferencia CustomVoice de VoiceDesign?

CustomVoice utiliza nueve locutores fijos que usted selecciona. VoiceDesign no tiene una lista preestablecida; usted describe la voz que desea con palabras, como edad, estado de ánimo y prosodia, y el modelo la crea. Elija CustomVoice para obtener consistencia y VoiceDesign para obtener voces nuevas.

¿Qué idiomas habla?

Diez: chino, inglés, japonés, coreano, alemán, francés, ruso, portugués, español e italiano. La tarjeta del modelo aconseja utilizar cada locutor en su idioma nativo para obtener la mejor calidad.

¿Es lo suficientemente rápido para una conversación en vivo?

Alibaba afirma que la latencia de síntesis de extremo a extremo es de tan solo 97 ms, orientada al uso en tiempo real. El retardo real en su aplicación también depende de la distancia de la red y la longitud del texto, por lo que debe medirlo con su propio tráfico.

¿Cuánto cuesta Qwen3-TTS 1.7B CustomVoice?

En TokenLab, Qwen3-TTS 1.7B CustomVoice cuesta - . La tabla de precios arriba muestra el desglose completo. Las tarifas dependen de la unidad de facturación, la especificación y el uso. Compare condiciones iguales en el precio detallado del modelo; una sola tarifa no determina el coste total.

¿Qué endpoint debe usar Qwen3-TTS 1.7B CustomVoice?

Utiliza https://api.tokenlab.sh/v1/audio/speech para Qwen3-TTS 1.7B CustomVoice. El ejemplo de solicitud a continuación muestra la estructura de código correspondiente.

¿Qué operaciones soporta Qwen3-TTS 1.7B CustomVoice?

Qwen3-TTS 1.7B CustomVoice admite Texto a voz. Selecciona una operación arriba para ver su endpoint y ejemplo de solicitud.

Comparar Qwen3-TTS 1.7B CustomVoice

Fuentes

Revisado el 2 oct 2026

Más de Qwen TTS

Modelos relacionados