Alibaba: CosyVoice v3.5 Plus
cosyvoice-v3.5-plus- Entrada / Saída
- $22.06 / $0.00
- Modalidades
- Áudio
Sobre o CosyVoice v3.5 Plus
O CosyVoice v3.5 Plus é o modelo de síntese de voz da Alibaba para vozes que você mesmo cria. Ele não possui uma lista de vozes padrão: você clona uma voz a partir de uma amostra ou projeta uma a partir de uma descrição em texto e, em seguida, sintetiza com ela por meio de uma conexão WebSocket. Ele fala mandarim, inglês e vários outros idiomas, além de muitos dialetos regionais chineses, e aceita instruções em linguagem natural para direcionar a entrega, o que o Qwen3-TTS-Flash não faz.
Pontos fortes
- Funciona com vozes clonadas a partir de uma gravação ou vozes projetadas a partir de uma descrição escrita.
- Aceita instruções para controlar o tom e o estilo de fala.
- Fala mandarim, cantonês e muitos dialetos regionais chineses, bem como inglês, francês, alemão, japonês, coreano, russo, português, tailandês, indonésio e vietnamita.
- Transmite áudio via WebSocket, para que a reprodução possa começar antes que a síntese termine.
Quando usar outro modelo
- Ele não possui vozes de sistema integradas; você deve primeiro criar uma voz clonada ou projetada.
- Requer um cliente WebSocket em vez de uma simples solicitação HTTP.
- A clonagem de voz precisa de uma amostra de referência limpa e consentimento para usar essa voz.
Primeiros passos
Criar chave de API
Crie uma chave no Console e use com qualquer modelo da plataforma.
Envie sua primeira requisição
Copie o exemplo para sua linguagem e execute-o no endpoint.
Texto para falaEndpoint do TokenLabPOST/v1/audio/speechcurl -X POST "https://api.tokenlab.sh/v1/audio/speech" \ -H "Authorization: Bearer sk-xxx" \ -H "Content-Type: application/json" \ -d '{ "operation": "tts", "response_format": "mp3", "speed": 1, "model": "cosyvoice-v3.5-plus", "input": "Hello from TokenLab.", "voice": "alloy" }'
Preço
O preço oficial é a base pública do criador do modelo. O preço TokenLab é o que você paga por este modelo na TokenLab.
Cosy Tts Number
Por milhão de caracteres- Preço oficial
- Entrada $22.06 / Saída $0.00
- Official
- Entrada $22.06 / Saída $0.00
- Desconto
- —
| Preço oficialPor milhão de caracteres | OfficialPor milhão de caracteres | Desconto | |
|---|---|---|---|
| Cosy Tts Number | Entrada $22.06 / Saída $0.00 | Entrada $22.06 / Saída $0.00 | — |
Uso e atividade
A taxa de sucesso é a proporção de requisições concluídas. A latência é quanto tempo uma resposta completa leva; P95 significa que 95% das requisições terminaram dentro desse tempo.
Uso e disponibilidade
Últimas 24 horas- Requisições
- Taxa de sucesso
- Latência P95
- Total de tokens
Os dados baseiam-se em solicitações agregadas de usuários, excluindo verificações de status.
Abrir no Console
Abra CosyVoice v3.5 Plus no Console com um prompt pronto para editar ou enviar.
Ajude-me a testar cosyvoice-v3.5-plus com uma solicitação de áudio em /v1/audio/speech. Exiba o resultado e custo.
Casos de uso
Voz de marca
Clone um locutor aprovado uma vez e use a voz para tours de produtos, prompts de URA e anúncios.
Vozes de personagens
Projete uma voz a partir de uma descrição, como um contador de histórias mais velho e caloroso, para audiolivros ou jogos.
Narração em dialeto regional
Produza conteúdo falado em Sichuan, Xangai ou cantonês para públicos locais.
Exemplos de prompt
Leia este anúncio em um tom rápido e otimista, com uma pequena pausa após a data.
Fale o parágrafo a seguir de forma lenta e calorosa, como se estivesse lendo uma história de ninar.
Diga isto em cantonês com um ritmo relaxado e coloquial.
FAQ
O CosyVoice v3.5 Plus possui vozes predefinidas?
Não. A Alibaba não lista vozes de sistema para este modelo. Você precisa de uma voz clonada a partir de uma amostra ou de uma voz projetada a partir de uma descrição em texto e, em seguida, passar essa voz ao sintetizar.
Quais idiomas e dialetos ele suporta?
Mandarim, cantonês e muitos dialetos regionais chineses, além de inglês, francês, alemão, japonês, coreano, russo, português, tailandês, indonésio e vietnamita. O suporte a dialetos é uma das principais diferenças em relação aos modelos Qwen3-TTS-Flash.
Posso controlar como ele soa?
Sim. O modelo suporta controle por instruções, para que você possa descrever o tom, a emoção ou o ritmo em linguagem natural. A escolha da voz define quem fala; a instrução molda como a fala é entregue.
Como ele é chamado?
Por meio de uma API WebSocket que transmite o áudio conforme ele é gerado. Isso é adequado para scripts longos e reprodução ao vivo, mas você precisará de um cliente que gerencie a conexão.
Quando devo escolher o Qwen3-TTS-Flash?
Quando você deseja vozes prontas e uma chamada HTTP simples e não precisa de clonagem ou instruções. Escolha o CosyVoice quando a identidade da voz ou o estilo de entrega fizerem parte do seu produto.
Quanto custa o CosyVoice v3.5 Plus?
No TokenLab, CosyVoice v3.5 Plus custa Entrada $22.06 / Saída $0.00 Por milhão de caracteres. A tabela de preços acima mostra o detalhamento completo. As tarifas dependem da unidade de cobrança, da especificação e do uso. Compare condições iguais no preço detalhado do modelo; uma única tarifa não determina o custo total.
Qual endpoint o CosyVoice v3.5 Plus deve usar?
Use https://api.tokenlab.sh/v1/audio/speech para CosyVoice v3.5 Plus. O exemplo de requisição abaixo mostra o formato de código correspondente.
Quais operações o CosyVoice v3.5 Plus suporta?
CosyVoice v3.5 Plus suporta Texto para fala. Selecione uma operação acima para ver seu endpoint e exemplo de requisição.
Comparar CosyVoice v3.5 Plus
Fontes
Revisado em 2 de out. de 2026