Alibaba: Qwen3-TTS 1.7B VoiceDesign
qwen3-tts-1-7b-voicedesign- Preço
- A partir de $0.000015
- Modalidades
- Áudio
Sobre o Qwen3-TTS 1.7B VoiceDesign
O Qwen3-TTS 1.7B VoiceDesign é a variante de conversão de texto em fala da Alibaba que cria uma voz a partir de uma descrição escrita em vez de uma lista predefinida. Você descreve a emoção, o tom e a prosódia em linguagem natural, e o modelo fala o texto com essa voz. Ele cobre dez idiomas e destina-se a casos em que nenhum locutor existente se encaixa no personagem ou na marca que você tem em mente.
Pontos fortes
- Uma voz é definida por uma descrição, como um narrador idoso com uma entrega lenta e calorosa, em vez de ser escolhida de uma lista fixa.
- O timbre, a emoção e a prosódia podem ser direcionados por instrução, incluindo humores fortes como raiva.
- Dez idiomas são cobertos: chinês, inglês, japonês, coreano, alemão, francês, russo, português, espanhol e italiano, além de variantes de dialetos.
- A Alibaba lista uma baixa latência de síntese de cerca de 97 ms para a família Qwen3-TTS, portanto, ela se adapta ao uso interativo.
Quando usar outro modelo
- A mesma descrição pode produzir vozes ligeiramente diferentes em chamadas diferentes, por isso é uma escolha mais fraca quando uma voz exata precisa se repetir por meses.
- Se você deseja um locutor nomeado fixo, a variante CustomVoice com nove predefinições é mais previsível.
- A qualidade depende de quão claramente você descreve a voz; descrições vagas dão resultados genéricos.
Primeiros passos
Criar chave de API
Crie uma chave no Console e use com qualquer modelo da plataforma.
Envie sua primeira requisição
Copie o exemplo para sua linguagem e execute-o no endpoint.
Texto para falaEndpoint do TokenLabPOST/v1/audio/speechcurl -X POST "https://api.tokenlab.sh/v1/audio/speech" \ -H "Authorization: Bearer sk-xxx" \ -H "Content-Type: application/json" \ -d '{ "operation": "tts", "model": "qwen3-tts-1-7b-voicedesign", "input": "Hello from TokenLab.", "voice": "alloy" }'
Preço
O preço oficial é a base pública do criador do modelo. O preço TokenLab é o que você paga por este modelo na TokenLab.
Texto para fala
Por milhão de caracteres- Preço oficial
- $0.000015
- Official
- $0.000015
- Desconto
- —
| Preço oficialPor milhão de caracteres | OfficialPor milhão de caracteres | Desconto | |
|---|---|---|---|
| Texto para fala | $0.000015 | $0.000015 | — |
Uso e atividade
A taxa de sucesso é a proporção de requisições concluídas. A latência é quanto tempo uma resposta completa leva; P95 significa que 95% das requisições terminaram dentro desse tempo.
Uso e disponibilidade
Últimas 24 horas- Requisições
- Taxa de sucesso
- Latência P95
- Total de tokens
Os dados baseiam-se em solicitações agregadas de usuários, excluindo verificações de status.
Abrir no Console
Abra Qwen3-TTS 1.7B VoiceDesign no Console com um prompt pronto para editar ou enviar.
Ajude-me a testar qwen3-tts-1-7b-voicedesign com uma solicitação de áudio em /v1/audio/speech. Exiba o resultado e custo.
Casos de uso
Vozes de personagens para jogos
Descreva cada personagem, por exemplo, um ferreiro anão rude ou um jovem mensageiro nervoso, e gere falas sem precisar contratar um dublador primeiro.
Exploração de voz da marca
Experimente várias descrições de uma voz corporativa, como confiante e grave versus brilhante e rápida, e compare-as no mesmo roteiro.
Narração expressiva
Direcione a entrega para seções da história com instruções como abafado e tenso, depois aliviado e caloroso, dentro de um único projeto.
Vozes de protótipo para vídeo
Crie um narrador temporário para um storyboard ou vídeo explicativo antes que a voz final seja escolhida.
Exemplos de prompt
Voz: uma mulher de meia-idade, calma e grave, falando lentamente como um narrador de documentário. Texto: The river has changed course three times in the last century.
Voz: um jovem, animado e ligeiramente ofegante, ritmo rápido. Texto: You will not believe what just came through the door.
Voz: fale em um tom especialmente irritado, rápido e cortante (用特别愤怒的语气说). Texto: 这已经是第三次了,你们到底有没有在听?
FAQ
Para que serve o Qwen3-TTS VoiceDesign?
Ele gera fala com uma voz que você especifica em palavras. Em vez de selecionar um locutor nomeado, você escreve uma descrição cobrindo emoção, tom e entrega, e o modelo produz áudio que segue essas instruções. Ele se adapta a personagens e vozes de marca que não correspondem a uma predefinição padrão.
Como ele é diferente do CustomVoice?
O CustomVoice oferece nove locutores nomeados fixos com instruções de estilo opcionais. O VoiceDesign não possui uma lista fixa e constrói a voz a partir da sua descrição. Escolha o VoiceDesign para criar algo novo e o CustomVoice para um locutor estável e repetível.
Quais idiomas são suportados?
Dez: chinês, inglês, japonês, coreano, alemão, francês, russo, português, espanhol e italiano, juntamente com algumas variantes de dialetos. Escreva a descrição da voz em um idioma que o modelo entenda; o exemplo no cartão do modelo usa chinês.
Posso clonar a voz de uma pessoa real com ele?
A família Qwen3-TTS descreve a clonagem de voz a partir de uma amostra curta, mas o foco desta variante é o design baseado em instruções. Apenas clone ou imite vozes que você tem permissão para usar e verifique a saída em relação às suas próprias regras de consentimento.
A voz será idêntica em todas as chamadas?
Não é garantido. Uma descrição direciona a voz, mas não fixa um timbre exato, portanto, chamadas repetidas podem soar ligeiramente diferentes. Se você precisar de repetição exata em um projeto longo, use um locutor predefinido fixo.
Quanto custa o Qwen3-TTS 1.7B VoiceDesign?
No TokenLab, Qwen3-TTS 1.7B VoiceDesign custa - . A tabela de preços acima mostra o detalhamento completo. As tarifas dependem da unidade de cobrança, da especificação e do uso. Compare condições iguais no preço detalhado do modelo; uma única tarifa não determina o custo total.
Qual endpoint o Qwen3-TTS 1.7B VoiceDesign deve usar?
Use https://api.tokenlab.sh/v1/audio/speech para Qwen3-TTS 1.7B VoiceDesign. O exemplo de requisição abaixo mostra o formato de código correspondente.
Quais operações o Qwen3-TTS 1.7B VoiceDesign suporta?
Qwen3-TTS 1.7B VoiceDesign suporta Texto para fala. Selecione uma operação acima para ver seu endpoint e exemplo de requisição.
Comparar Qwen3-TTS 1.7B VoiceDesign
Fontes
Revisado em 2 de out. de 2026