Alibaba: CosyVoice v3.5 Plus
cosyvoice-v3.5-plus- Entrada / Salida
- $22.06 / $0.00
- Modalidades
- Audio
Sobre CosyVoice v3.5 Plus
CosyVoice v3.5 Plus es el modelo de síntesis de voz de Alibaba para voces que usted mismo crea. No tiene una lista de voces predeterminadas: usted clona una voz a partir de una muestra o diseña una a partir de una descripción de texto, y luego sintetiza con ella a través de una conexión WebSocket. Habla mandarín, inglés y varios otros idiomas, además de muchos dialectos regionales chinos, y acepta instrucciones en lenguaje natural para dirigir la entrega, algo que Qwen3-TTS-Flash no hace.
Puntos fuertes
- Funciona con voces clonadas a partir de una grabación o voces diseñadas a partir de una descripción escrita.
- Acepta instrucciones para controlar el tono y el estilo de habla.
- Habla mandarín, cantonés y muchos dialectos regionales chinos, así como inglés, francés, alemán, japonés, coreano, ruso, portugués, tailandés, indonesio y vietnamita.
- Transmite audio a través de WebSocket, por lo que la reproducción puede comenzar antes de que finalice la síntesis.
Cuándo buscar otra opción
- No tiene voces de sistema integradas; primero debe crear una voz clonada o diseñada.
- Requiere un cliente WebSocket en lugar de una simple solicitud HTTP.
- La clonación de voz necesita una muestra de referencia limpia y consentimiento para usar esa voz.
Primeros pasos
Crear clave API
Genera una clave en Console y úsala con cualquier modelo de la plataforma.
Envía tu primera solicitud
Copia el ejemplo para tu lenguaje y ejecútalo contra el endpoint.
Texto a vozEndpoint de TokenLabPOST/v1/audio/speechcurl -X POST "https://api.tokenlab.sh/v1/audio/speech" \ -H "Authorization: Bearer sk-xxx" \ -H "Content-Type: application/json" \ -d '{ "operation": "tts", "response_format": "mp3", "speed": 1, "model": "cosyvoice-v3.5-plus", "input": "Hello from TokenLab.", "voice": "alloy" }'
Precios
El precio oficial es la línea base pública del creador del modelo. El precio de TokenLab es lo que pagas por este modelo en TokenLab.
Cosy Tts Number
Por millón de caracteres- Precio Official
- Entrada $22.06 / Salida $0.00
- Official
- Entrada $22.06 / Salida $0.00
- Descuento
- —
| Precio OfficialPor millón de caracteres | OfficialPor millón de caracteres | Descuento | |
|---|---|---|---|
| Cosy Tts Number | Entrada $22.06 / Salida $0.00 | Entrada $22.06 / Salida $0.00 | — |
Uso y actividad
La tasa de éxito es la proporción de solicitudes completadas. La latencia es cuánto tarda una respuesta completa; P95 significa que el 95 % de las solicitudes terminaron dentro de ese tiempo.
Uso y disponibilidad
Últimas 24 horas- Solicitudes
- Tasa de éxito
- Latencia P95
- Total de tokens
Los datos se basan en solicitudes de usuario agregadas, excluyendo las comprobaciones de estado.
Abrir en Console
Abre CosyVoice v3.5 Plus en Console con un prompt listo para editar o enviar.
Ayúdame a probar cosyvoice-v3.5-plus con una solicitud de audio breve en /v1/audio/speech. Muestra el resultado y el coste.
Casos de uso
Voz de marca
Clone a un hablante aprobado una vez y utilice la voz para recorridos de productos, avisos de IVR y anuncios.
Voces de personajes
Diseñe una voz a partir de una descripción, como un narrador mayor y cálido, para audiolibros o juegos.
Narración en dialectos regionales
Produzca contenido hablado en dialectos de Sichuan, Shanghái o cantonés para audiencias locales.
Ejemplos de prompts
Lea este anuncio con un tono enérgico y alegre, con una breve pausa después de la fecha.
Diga el siguiente párrafo lenta y cálidamente, como si estuviera leyendo un cuento antes de dormir.
Diga esto en cantonés con un ritmo relajado y conversacional.
FAQ
¿Tiene CosyVoice v3.5 Plus voces preestablecidas?
No. Alibaba no enumera voces de sistema para este modelo. Necesita una voz clonada a partir de una muestra o una voz diseñada a partir de una descripción de texto, y luego pasar esa voz al sintetizar.
¿Qué idiomas y dialectos admite?
Mandarín, cantonés y muchos dialectos regionales chinos, además de inglés, francés, alemán, japonés, coreano, ruso, portugués, tailandés, indonesio y vietnamita. El soporte de dialectos es una diferencia principal con respecto a los modelos Qwen3-TTS-Flash.
¿Puedo controlar cómo suena?
Sí. El modelo admite el control mediante instrucciones, por lo que puede describir el tono, la emoción o el ritmo en lenguaje natural. La elección de la voz establece quién habla; la instrucción da forma a cómo se entrega la línea.
¿Cómo se llama?
A través de una API WebSocket que transmite el audio a medida que se genera. Esto es adecuado para guiones largos y reproducción en vivo, pero necesitará un cliente que maneje la conexión.
¿Cuándo debería elegir Qwen3-TTS-Flash en su lugar?
Cuando desee voces listas para usar y una llamada HTTP simple y no necesite clonación ni instrucciones. Elija CosyVoice cuando la identidad de la voz o el estilo de entrega sean parte de su producto.
¿Cuánto cuesta CosyVoice v3.5 Plus?
En TokenLab, CosyVoice v3.5 Plus cuesta Entrada $22.06 / Salida $0.00 Por millón de caracteres. La tabla de precios arriba muestra el desglose completo. Las tarifas dependen de la unidad de facturación, la especificación y el uso. Compare condiciones iguales en el precio detallado del modelo; una sola tarifa no determina el coste total.
¿Qué endpoint debe usar CosyVoice v3.5 Plus?
Utiliza https://api.tokenlab.sh/v1/audio/speech para CosyVoice v3.5 Plus. El ejemplo de solicitud a continuación muestra la estructura de código correspondiente.
¿Qué operaciones soporta CosyVoice v3.5 Plus?
CosyVoice v3.5 Plus admite Texto a voz. Selecciona una operación arriba para ver su endpoint y ejemplo de solicitud.
Comparar CosyVoice v3.5 Plus
Fuentes
Revisado el 2 oct 2026