Escolha Auto, TokenLab Verified ou Official para cada solicitação, com preços exibidos antecipadamente.Veja as novidades

Alibaba: Qwen3-TTS 1.7B VoiceDesign

O Qwen3-TTS 1.7B VoiceDesign é um modelo de texto para fala da Alibaba que cria vozes personalizadas a partir de descrições em linguagem natural especificando emoção, tom e prosódia. Suporta clonagem de voz a partir de uma amostra de áudio de 3 segundos, gera fala em mais de 10 idiomas, incluindo chinês, inglês, japonês, coreano e idiomas europeus, e atinge latência tão baixa quanto 97ms.
Comparar modelos
qwen3-tts-1-7b-voicedesign
DisponívelAlibabaTexto para falaSíncrono
Preço
A partir de $0.000015
Modalidades
Áudio

Sobre o Qwen3-TTS 1.7B VoiceDesign

O Qwen3-TTS 1.7B VoiceDesign é a variante de conversão de texto em fala da Alibaba que cria uma voz a partir de uma descrição escrita em vez de uma lista predefinida. Você descreve a emoção, o tom e a prosódia em linguagem natural, e o modelo fala o texto com essa voz. Ele cobre dez idiomas e destina-se a casos em que nenhum locutor existente se encaixa no personagem ou na marca que você tem em mente.

Pontos fortes

  • Uma voz é definida por uma descrição, como um narrador idoso com uma entrega lenta e calorosa, em vez de ser escolhida de uma lista fixa.
  • O timbre, a emoção e a prosódia podem ser direcionados por instrução, incluindo humores fortes como raiva.
  • Dez idiomas são cobertos: chinês, inglês, japonês, coreano, alemão, francês, russo, português, espanhol e italiano, além de variantes de dialetos.
  • A Alibaba lista uma baixa latência de síntese de cerca de 97 ms para a família Qwen3-TTS, portanto, ela se adapta ao uso interativo.

Quando usar outro modelo

  • A mesma descrição pode produzir vozes ligeiramente diferentes em chamadas diferentes, por isso é uma escolha mais fraca quando uma voz exata precisa se repetir por meses.
  • Se você deseja um locutor nomeado fixo, a variante CustomVoice com nove predefinições é mais previsível.
  • A qualidade depende de quão claramente você descreve a voz; descrições vagas dão resultados genéricos.

Primeiros passos

  1. Criar chave de API

    Crie uma chave no Console e use com qualquer modelo da plataforma.

  2. Envie sua primeira requisição

    Copie o exemplo para sua linguagem e execute-o no endpoint.

    Texto para falaEndpoint do TokenLab
    POST/v1/audio/speech
    curl -X POST "https://api.tokenlab.sh/v1/audio/speech" \
      -H "Authorization: Bearer sk-xxx" \
      -H "Content-Type: application/json" \
      -d '{
      "operation": "tts",
      "model": "qwen3-tts-1-7b-voicedesign",
      "input": "Hello from TokenLab.",
      "voice": "alloy"
    }'

Preço

O preço oficial é a base pública do criador do modelo. O preço TokenLab é o que você paga por este modelo na TokenLab.

Texto para fala

Por milhão de caracteres
Preço oficial
$0.000015
Official
$0.000015
Desconto
—

Uso e atividade

A taxa de sucesso é a proporção de requisições concluídas. A latência é quanto tempo uma resposta completa leva; P95 significa que 95% das requisições terminaram dentro desse tempo.

Uso e disponibilidade

Últimas 24 horas
Requisições
Taxa de sucesso
Latência P95
Total de tokens
Desempenho do modelo
As métricas aparecerão assim que os limites de privacidade e volume de dados forem atingidos.

Os dados baseiam-se em solicitações agregadas de usuários, excluindo verificações de status.

Abrir no Console

Abra Qwen3-TTS 1.7B VoiceDesign no Console com um prompt pronto para editar ou enviar.

Ajude-me a testar qwen3-tts-1-7b-voicedesign com uma solicitação de áudio em /v1/audio/speech. Exiba o resultado e custo.

Casos de uso

  • Vozes de personagens para jogos

    Descreva cada personagem, por exemplo, um ferreiro anão rude ou um jovem mensageiro nervoso, e gere falas sem precisar contratar um dublador primeiro.

  • Exploração de voz da marca

    Experimente várias descrições de uma voz corporativa, como confiante e grave versus brilhante e rápida, e compare-as no mesmo roteiro.

  • Narração expressiva

    Direcione a entrega para seções da história com instruções como abafado e tenso, depois aliviado e caloroso, dentro de um único projeto.

  • Vozes de protótipo para vídeo

    Crie um narrador temporário para um storyboard ou vídeo explicativo antes que a voz final seja escolhida.

Exemplos de prompt

Voz: uma mulher de meia-idade, calma e grave, falando lentamente como um narrador de documentário. Texto: The river has changed course three times in the last century.

Voz: um jovem, animado e ligeiramente ofegante, ritmo rápido. Texto: You will not believe what just came through the door.

Voz: fale em um tom especialmente irritado, rápido e cortante (用特别愤怒的语气说). Texto: 这已经是第三次了,你们到底有没有在听?

FAQ

Para que serve o Qwen3-TTS VoiceDesign?

Ele gera fala com uma voz que você especifica em palavras. Em vez de selecionar um locutor nomeado, você escreve uma descrição cobrindo emoção, tom e entrega, e o modelo produz áudio que segue essas instruções. Ele se adapta a personagens e vozes de marca que não correspondem a uma predefinição padrão.

Como ele é diferente do CustomVoice?

O CustomVoice oferece nove locutores nomeados fixos com instruções de estilo opcionais. O VoiceDesign não possui uma lista fixa e constrói a voz a partir da sua descrição. Escolha o VoiceDesign para criar algo novo e o CustomVoice para um locutor estável e repetível.

Quais idiomas são suportados?

Dez: chinês, inglês, japonês, coreano, alemão, francês, russo, português, espanhol e italiano, juntamente com algumas variantes de dialetos. Escreva a descrição da voz em um idioma que o modelo entenda; o exemplo no cartão do modelo usa chinês.

Posso clonar a voz de uma pessoa real com ele?

A família Qwen3-TTS descreve a clonagem de voz a partir de uma amostra curta, mas o foco desta variante é o design baseado em instruções. Apenas clone ou imite vozes que você tem permissão para usar e verifique a saída em relação às suas próprias regras de consentimento.

A voz será idêntica em todas as chamadas?

Não é garantido. Uma descrição direciona a voz, mas não fixa um timbre exato, portanto, chamadas repetidas podem soar ligeiramente diferentes. Se você precisar de repetição exata em um projeto longo, use um locutor predefinido fixo.

Quanto custa o Qwen3-TTS 1.7B VoiceDesign?

No TokenLab, Qwen3-TTS 1.7B VoiceDesign custa - . A tabela de preços acima mostra o detalhamento completo. As tarifas dependem da unidade de cobrança, da especificação e do uso. Compare condições iguais no preço detalhado do modelo; uma única tarifa não determina o custo total.

Qual endpoint o Qwen3-TTS 1.7B VoiceDesign deve usar?

Use https://api.tokenlab.sh/v1/audio/speech para Qwen3-TTS 1.7B VoiceDesign. O exemplo de requisição abaixo mostra o formato de código correspondente.

Quais operações o Qwen3-TTS 1.7B VoiceDesign suporta?

Qwen3-TTS 1.7B VoiceDesign suporta Texto para fala. Selecione uma operação acima para ver seu endpoint e exemplo de requisição.

Comparar Qwen3-TTS 1.7B VoiceDesign

Fontes

Revisado em 2 de out. de 2026

Mais da série Qwen TTS

Modelos relacionados