Escolha Auto, TokenLab Verified ou Official para cada solicitação, com preços exibidos antecipadamente.Veja as novidades

Alibaba: CosyVoice v3.5 Plus

O CosyVoice v3.5 Plus transforma roteiros escritos em fala expressiva. Use-o para artigos narrados, locuções conversacionais e orientação de produtos falada, com voz e velocidade de fala escolhidas para se adequar ao público.
Comparar modelos
cosyvoice-v3.5-plus
DisponívelAlibabaTexto para falaSíncrono
Entrada / Saída
$22.06 / $0.00
Modalidades
Áudio

Sobre o CosyVoice v3.5 Plus

O CosyVoice v3.5 Plus é o modelo de síntese de voz da Alibaba para vozes que você mesmo cria. Ele não possui uma lista de vozes padrão: você clona uma voz a partir de uma amostra ou projeta uma a partir de uma descrição em texto e, em seguida, sintetiza com ela por meio de uma conexão WebSocket. Ele fala mandarim, inglês e vários outros idiomas, além de muitos dialetos regionais chineses, e aceita instruções em linguagem natural para direcionar a entrega, o que o Qwen3-TTS-Flash não faz.

Pontos fortes

  • Funciona com vozes clonadas a partir de uma gravação ou vozes projetadas a partir de uma descrição escrita.
  • Aceita instruções para controlar o tom e o estilo de fala.
  • Fala mandarim, cantonês e muitos dialetos regionais chineses, bem como inglês, francês, alemão, japonês, coreano, russo, português, tailandês, indonésio e vietnamita.
  • Transmite áudio via WebSocket, para que a reprodução possa começar antes que a síntese termine.

Quando usar outro modelo

  • Ele não possui vozes de sistema integradas; você deve primeiro criar uma voz clonada ou projetada.
  • Requer um cliente WebSocket em vez de uma simples solicitação HTTP.
  • A clonagem de voz precisa de uma amostra de referência limpa e consentimento para usar essa voz.

Primeiros passos

  1. Criar chave de API

    Crie uma chave no Console e use com qualquer modelo da plataforma.

  2. Envie sua primeira requisição

    Copie o exemplo para sua linguagem e execute-o no endpoint.

    Texto para falaEndpoint do TokenLab
    POST/v1/audio/speech
    curl -X POST "https://api.tokenlab.sh/v1/audio/speech" \
      -H "Authorization: Bearer sk-xxx" \
      -H "Content-Type: application/json" \
      -d '{
      "operation": "tts",
      "response_format": "mp3",
      "speed": 1,
      "model": "cosyvoice-v3.5-plus",
      "input": "Hello from TokenLab.",
      "voice": "alloy"
    }'

Preço

O preço oficial é a base pública do criador do modelo. O preço TokenLab é o que você paga por este modelo na TokenLab.

Cosy Tts Number

Por milhão de caracteres
Preço oficial
Entrada $22.06 / Saída $0.00
Official
Entrada $22.06 / Saída $0.00
Desconto
—

Uso e atividade

A taxa de sucesso é a proporção de requisições concluídas. A latência é quanto tempo uma resposta completa leva; P95 significa que 95% das requisições terminaram dentro desse tempo.

Uso e disponibilidade

Últimas 24 horas
Requisições
Taxa de sucesso
Latência P95
Total de tokens
Desempenho do modelo
As métricas aparecerão assim que os limites de privacidade e volume de dados forem atingidos.

Os dados baseiam-se em solicitações agregadas de usuários, excluindo verificações de status.

Abrir no Console

Abra CosyVoice v3.5 Plus no Console com um prompt pronto para editar ou enviar.

Ajude-me a testar cosyvoice-v3.5-plus com uma solicitação de áudio em /v1/audio/speech. Exiba o resultado e custo.

Casos de uso

  • Voz de marca

    Clone um locutor aprovado uma vez e use a voz para tours de produtos, prompts de URA e anúncios.

  • Vozes de personagens

    Projete uma voz a partir de uma descrição, como um contador de histórias mais velho e caloroso, para audiolivros ou jogos.

  • Narração em dialeto regional

    Produza conteúdo falado em Sichuan, Xangai ou cantonês para públicos locais.

Exemplos de prompt

Leia este anúncio em um tom rápido e otimista, com uma pequena pausa após a data.

Fale o parágrafo a seguir de forma lenta e calorosa, como se estivesse lendo uma história de ninar.

Diga isto em cantonês com um ritmo relaxado e coloquial.

FAQ

O CosyVoice v3.5 Plus possui vozes predefinidas?

Não. A Alibaba não lista vozes de sistema para este modelo. Você precisa de uma voz clonada a partir de uma amostra ou de uma voz projetada a partir de uma descrição em texto e, em seguida, passar essa voz ao sintetizar.

Quais idiomas e dialetos ele suporta?

Mandarim, cantonês e muitos dialetos regionais chineses, além de inglês, francês, alemão, japonês, coreano, russo, português, tailandês, indonésio e vietnamita. O suporte a dialetos é uma das principais diferenças em relação aos modelos Qwen3-TTS-Flash.

Posso controlar como ele soa?

Sim. O modelo suporta controle por instruções, para que você possa descrever o tom, a emoção ou o ritmo em linguagem natural. A escolha da voz define quem fala; a instrução molda como a fala é entregue.

Como ele é chamado?

Por meio de uma API WebSocket que transmite o áudio conforme ele é gerado. Isso é adequado para scripts longos e reprodução ao vivo, mas você precisará de um cliente que gerencie a conexão.

Quando devo escolher o Qwen3-TTS-Flash?

Quando você deseja vozes prontas e uma chamada HTTP simples e não precisa de clonagem ou instruções. Escolha o CosyVoice quando a identidade da voz ou o estilo de entrega fizerem parte do seu produto.

Quanto custa o CosyVoice v3.5 Plus?

No TokenLab, CosyVoice v3.5 Plus custa Entrada $22.06 / Saída $0.00 Por milhão de caracteres. A tabela de preços acima mostra o detalhamento completo. As tarifas dependem da unidade de cobrança, da especificação e do uso. Compare condições iguais no preço detalhado do modelo; uma única tarifa não determina o custo total.

Qual endpoint o CosyVoice v3.5 Plus deve usar?

Use https://api.tokenlab.sh/v1/audio/speech para CosyVoice v3.5 Plus. O exemplo de requisição abaixo mostra o formato de código correspondente.

Quais operações o CosyVoice v3.5 Plus suporta?

CosyVoice v3.5 Plus suporta Texto para fala. Selecione uma operação acima para ver seu endpoint e exemplo de requisição.

Comparar CosyVoice v3.5 Plus

Fontes

Revisado em 2 de out. de 2026

Modelos relacionados