Alibaba: Qwen3-TTS 1.7B CustomVoice
qwen3-tts-1-7b-customvoice- Preço
- A partir de $0.000015
- Modalidades
- Áudio
Sobre o Qwen3-TTS 1.7B CustomVoice
O Qwen3-TTS 1.7B CustomVoice é o modelo de conversão de texto em fala da Alibaba, construído em torno de um conjunto fixo de nove vozes predefinidas. Você escolhe um locutor pelo nome e pode adicionar uma instrução em linguagem simples sobre tom, emoção ou estilo de fala. Ele fala dez idiomas, incluindo chinês, inglês, japonês, coreano e vários idiomas europeus, e a Alibaba cita uma latência de síntese de ponta a ponta de apenas 97 ms para uso interativo.
Pontos fortes
- Nove locutores premium nomeados cobrem diferentes gêneros, idades, idiomas e dialetos, para que uma voz possa permanecer a mesma em todo um produto.
- Uma instrução escrita pode direcionar a emoção e a maneira de falar sem alterar o locutor escolhido.
- Dez idiomas são suportados: chinês, inglês, japonês, coreano, alemão, francês, russo, português, espanhol e italiano.
- A Alibaba relata uma latência de ponta a ponta de apenas 97 ms, o que é adequado para assistentes de voz e narração ao vivo.
Quando usar outro modelo
- A lista de vozes é fixa; para inventar uma nova voz a partir de uma descrição, a variante VoiceDesign é a mais adequada.
- Os resultados são melhores quando um locutor lê seu próprio idioma nativo, portanto, uma predefinição em inglês lendo japonês pode soar com sotaque.
- Texto de entrada ruidoso ou incomum, como marcação pesada ou símbolos mistos, pode reduzir a qualidade da saída.
Primeiros passos
Criar chave de API
Crie uma chave no Console e use com qualquer modelo da plataforma.
Envie sua primeira requisição
Copie o exemplo para sua linguagem e execute-o no endpoint.
Texto para falaEndpoint do TokenLabPOST/v1/audio/speechcurl -X POST "https://api.tokenlab.sh/v1/audio/speech" \ -H "Authorization: Bearer sk-xxx" \ -H "Content-Type: application/json" \ -d '{ "operation": "tts", "model": "qwen3-tts-1-7b-customvoice", "input": "Hello from TokenLab.", "voice": "alloy" }'
Preço
O preço oficial é a base pública do criador do modelo. O preço TokenLab é o que você paga por este modelo na TokenLab.
Texto para fala
Por milhão de caracteres- Preço oficial
- $0.000015
- Official
- $0.000015
- Desconto
- —
| Preço oficialPor milhão de caracteres | OfficialPor milhão de caracteres | Desconto | |
|---|---|---|---|
| Texto para fala | $0.000015 | $0.000015 | — |
Uso e atividade
A taxa de sucesso é a proporção de requisições concluídas. A latência é quanto tempo uma resposta completa leva; P95 significa que 95% das requisições terminaram dentro desse tempo.
Uso e disponibilidade
Últimas 24 horas- Requisições
- Taxa de sucesso
- Latência P95
- Total de tokens
Os dados baseiam-se em solicitações agregadas de usuários, excluindo verificações de status.
Abrir no Console
Abra Qwen3-TTS 1.7B CustomVoice no Console com um prompt pronto para editar ou enviar.
Ajude-me a testar qwen3-tts-1-7b-customvoice com uma solicitação de áudio em /v1/audio/speech. Exiba o resultado e custo.
Casos de uso
Assistentes de voz
Dê a um assistente no aplicativo uma voz nomeada estável e baixo atraso de resposta para que as respostas comecem a ser reproduzidas rapidamente após o texto estar pronto.
Narração de audiolivros e artigos
Leia textos longos com um locutor escolhido e adicione uma instrução como calma e calorosa para manter a entrega consistente entre os capítulos.
Vídeos de produtos localizados
Use as predefinições em japonês, coreano ou inglês para dublar o mesmo roteiro por mercado, enquanto a marca mantém um som reconhecível.
Linhas de jogos e personagens
Escolha predefinições distintas para diferentes personagens e adicione instruções de emoção para falas irritadas, cansadas ou animadas.
Exemplos de prompt
Locutor: Ryan. Instrução: calmo, amigável, ligeiramente lento. Texto: Welcome back. Your order has shipped and should arrive on Thursday.
Locutor: Ono_Anna. Instrução: locutora alegre. Texto: 本日はご来店いただき、ありがとうございます。
Locutor: Vivian. Instrução: sussurro, como se contasse um segredo. Texto: 你听说了吗?明天会有一个大消息。
FAQ
Quais vozes o Qwen3-TTS CustomVoice oferece?
Nove predefinições: Vivian, Serena, Uncle_Fu, Dylan e Eric para variantes de chinês, Ryan e Aiden para inglês, Ono_Anna para japonês e Sohee para coreano. Você escolhe uma pelo nome para cada solicitação.
Posso controlar a emoção e o estilo de fala?
Sim. Você pode adicionar uma instrução em linguagem natural, por exemplo, irritado, gentil ou rápido e animado, e o modelo ajusta o tom e a maneira enquanto mantém o timbre do locutor selecionado.
Como o CustomVoice é diferente do VoiceDesign?
O CustomVoice usa nove locutores fixos que você seleciona. O VoiceDesign não possui uma lista predefinida; você descreve a voz que deseja em palavras, como idade, humor e prosódia, e o modelo a cria. Escolha o CustomVoice para consistência e o VoiceDesign para novas vozes.
Quais idiomas ele fala?
Dez: chinês, inglês, japonês, coreano, alemão, francês, russo, português, espanhol e italiano. O cartão do modelo recomenda usar cada locutor em seu idioma nativo para obter a melhor qualidade.
É rápido o suficiente para conversas ao vivo?
A Alibaba afirma que a latência de síntese de ponta a ponta é de apenas 97 ms, visando o uso em tempo real. O atraso real em seu aplicativo também depende da distância da rede e do comprimento do texto, portanto, meça-o com seu próprio tráfego.
Quanto custa o Qwen3-TTS 1.7B CustomVoice?
No TokenLab, Qwen3-TTS 1.7B CustomVoice custa - . A tabela de preços acima mostra o detalhamento completo. As tarifas dependem da unidade de cobrança, da especificação e do uso. Compare condições iguais no preço detalhado do modelo; uma única tarifa não determina o custo total.
Qual endpoint o Qwen3-TTS 1.7B CustomVoice deve usar?
Use https://api.tokenlab.sh/v1/audio/speech para Qwen3-TTS 1.7B CustomVoice. O exemplo de requisição abaixo mostra o formato de código correspondente.
Quais operações o Qwen3-TTS 1.7B CustomVoice suporta?
Qwen3-TTS 1.7B CustomVoice suporta Texto para fala. Selecione uma operação acima para ver seu endpoint e exemplo de requisição.
Comparar Qwen3-TTS 1.7B CustomVoice
Fontes
Revisado em 2 de out. de 2026