Elija Auto, TokenLab Verified o Official para cada solicitud, con los precios mostrados por adelantado.Ver las novedades

Alibaba: CosyVoice v3.5 Plus

CosyVoice v3.5 Plus convierte guiones escritos en voz expresiva. Úselo para artículos narrados, locuciones conversacionales y orientación de productos hablada, con una voz y velocidad de habla elegidas para adaptarse a la audiencia.
Comparar modelos
cosyvoice-v3.5-plus
DisponibleAlibabaTexto a vozSíncrono
Entrada / Salida
$22.06 / $0.00
Modalidades
Audio

Sobre CosyVoice v3.5 Plus

CosyVoice v3.5 Plus es el modelo de síntesis de voz de Alibaba para voces que usted mismo crea. No tiene una lista de voces predeterminadas: usted clona una voz a partir de una muestra o diseña una a partir de una descripción de texto, y luego sintetiza con ella a través de una conexión WebSocket. Habla mandarín, inglés y varios otros idiomas, además de muchos dialectos regionales chinos, y acepta instrucciones en lenguaje natural para dirigir la entrega, algo que Qwen3-TTS-Flash no hace.

Puntos fuertes

  • Funciona con voces clonadas a partir de una grabación o voces diseñadas a partir de una descripción escrita.
  • Acepta instrucciones para controlar el tono y el estilo de habla.
  • Habla mandarín, cantonés y muchos dialectos regionales chinos, así como inglés, francés, alemán, japonés, coreano, ruso, portugués, tailandés, indonesio y vietnamita.
  • Transmite audio a través de WebSocket, por lo que la reproducción puede comenzar antes de que finalice la síntesis.

Cuándo buscar otra opción

  • No tiene voces de sistema integradas; primero debe crear una voz clonada o diseñada.
  • Requiere un cliente WebSocket en lugar de una simple solicitud HTTP.
  • La clonación de voz necesita una muestra de referencia limpia y consentimiento para usar esa voz.

Primeros pasos

  1. Crear clave API

    Genera una clave en Console y úsala con cualquier modelo de la plataforma.

  2. Envía tu primera solicitud

    Copia el ejemplo para tu lenguaje y ejecútalo contra el endpoint.

    Texto a vozEndpoint de TokenLab
    POST/v1/audio/speech
    curl -X POST "https://api.tokenlab.sh/v1/audio/speech" \
      -H "Authorization: Bearer sk-xxx" \
      -H "Content-Type: application/json" \
      -d '{
      "operation": "tts",
      "response_format": "mp3",
      "speed": 1,
      "model": "cosyvoice-v3.5-plus",
      "input": "Hello from TokenLab.",
      "voice": "alloy"
    }'

Precios

El precio oficial es la línea base pública del creador del modelo. El precio de TokenLab es lo que pagas por este modelo en TokenLab.

Cosy Tts Number

Por millón de caracteres
Precio Official
Entrada $22.06 / Salida $0.00
Official
Entrada $22.06 / Salida $0.00
Descuento
—

Uso y actividad

La tasa de éxito es la proporción de solicitudes completadas. La latencia es cuánto tarda una respuesta completa; P95 significa que el 95 % de las solicitudes terminaron dentro de ese tiempo.

Uso y disponibilidad

Últimas 24 horas
Solicitudes
Tasa de éxito
Latencia P95
Total de tokens
Desempeño del modelo
Las métricas aparecerán una vez que se alcancen los umbrales de privacidad y volumen de datos.

Los datos se basan en solicitudes de usuario agregadas, excluyendo las comprobaciones de estado.

Abrir en Console

Abre CosyVoice v3.5 Plus en Console con un prompt listo para editar o enviar.

Ayúdame a probar cosyvoice-v3.5-plus con una solicitud de audio breve en /v1/audio/speech. Muestra el resultado y el coste.

Casos de uso

  • Voz de marca

    Clone a un hablante aprobado una vez y utilice la voz para recorridos de productos, avisos de IVR y anuncios.

  • Voces de personajes

    Diseñe una voz a partir de una descripción, como un narrador mayor y cálido, para audiolibros o juegos.

  • Narración en dialectos regionales

    Produzca contenido hablado en dialectos de Sichuan, Shanghái o cantonés para audiencias locales.

Ejemplos de prompts

Lea este anuncio con un tono enérgico y alegre, con una breve pausa después de la fecha.

Diga el siguiente párrafo lenta y cálidamente, como si estuviera leyendo un cuento antes de dormir.

Diga esto en cantonés con un ritmo relajado y conversacional.

FAQ

¿Tiene CosyVoice v3.5 Plus voces preestablecidas?

No. Alibaba no enumera voces de sistema para este modelo. Necesita una voz clonada a partir de una muestra o una voz diseñada a partir de una descripción de texto, y luego pasar esa voz al sintetizar.

¿Qué idiomas y dialectos admite?

Mandarín, cantonés y muchos dialectos regionales chinos, además de inglés, francés, alemán, japonés, coreano, ruso, portugués, tailandés, indonesio y vietnamita. El soporte de dialectos es una diferencia principal con respecto a los modelos Qwen3-TTS-Flash.

¿Puedo controlar cómo suena?

Sí. El modelo admite el control mediante instrucciones, por lo que puede describir el tono, la emoción o el ritmo en lenguaje natural. La elección de la voz establece quién habla; la instrucción da forma a cómo se entrega la línea.

¿Cómo se llama?

A través de una API WebSocket que transmite el audio a medida que se genera. Esto es adecuado para guiones largos y reproducción en vivo, pero necesitará un cliente que maneje la conexión.

¿Cuándo debería elegir Qwen3-TTS-Flash en su lugar?

Cuando desee voces listas para usar y una llamada HTTP simple y no necesite clonación ni instrucciones. Elija CosyVoice cuando la identidad de la voz o el estilo de entrega sean parte de su producto.

¿Cuánto cuesta CosyVoice v3.5 Plus?

En TokenLab, CosyVoice v3.5 Plus cuesta Entrada $22.06 / Salida $0.00 Por millón de caracteres. La tabla de precios arriba muestra el desglose completo. Las tarifas dependen de la unidad de facturación, la especificación y el uso. Compare condiciones iguales en el precio detallado del modelo; una sola tarifa no determina el coste total.

¿Qué endpoint debe usar CosyVoice v3.5 Plus?

Utiliza https://api.tokenlab.sh/v1/audio/speech para CosyVoice v3.5 Plus. El ejemplo de solicitud a continuación muestra la estructura de código correspondiente.

¿Qué operaciones soporta CosyVoice v3.5 Plus?

CosyVoice v3.5 Plus admite Texto a voz. Selecciona una operación arriba para ver su endpoint y ejemplo de solicitud.

Comparar CosyVoice v3.5 Plus

Fuentes

Revisado el 2 oct 2026

Modelos relacionados