Escolha Auto, TokenLab Verified ou Official para cada solicitação, com preços exibidos antecipadamente.Veja as novidades

Alibaba: Qwen3-TTS 1.7B CustomVoice

O Qwen3-TTS 1.7B CustomVoice é um modelo de texto para fala da Alibaba que oferece nove timbres predefinidos premium em várias combinações de gênero, idade, idioma e dialeto. Fornece controle de estilo preciso sobre vozes alvo por meio de instruções do usuário, suporta clonagem de voz a partir de uma amostra de 3 segundos e gera fala em mais de 10 idiomas com latência tão baixa quanto 97ms.
Comparar modelos
qwen3-tts-1-7b-customvoice
DisponívelAlibabaTexto para falaSíncrono
Preço
A partir de $0.000015
Modalidades
Áudio

Sobre o Qwen3-TTS 1.7B CustomVoice

O Qwen3-TTS 1.7B CustomVoice é o modelo de conversão de texto em fala da Alibaba, construído em torno de um conjunto fixo de nove vozes predefinidas. Você escolhe um locutor pelo nome e pode adicionar uma instrução em linguagem simples sobre tom, emoção ou estilo de fala. Ele fala dez idiomas, incluindo chinês, inglês, japonês, coreano e vários idiomas europeus, e a Alibaba cita uma latência de síntese de ponta a ponta de apenas 97 ms para uso interativo.

Pontos fortes

  • Nove locutores premium nomeados cobrem diferentes gêneros, idades, idiomas e dialetos, para que uma voz possa permanecer a mesma em todo um produto.
  • Uma instrução escrita pode direcionar a emoção e a maneira de falar sem alterar o locutor escolhido.
  • Dez idiomas são suportados: chinês, inglês, japonês, coreano, alemão, francês, russo, português, espanhol e italiano.
  • A Alibaba relata uma latência de ponta a ponta de apenas 97 ms, o que é adequado para assistentes de voz e narração ao vivo.

Quando usar outro modelo

  • A lista de vozes é fixa; para inventar uma nova voz a partir de uma descrição, a variante VoiceDesign é a mais adequada.
  • Os resultados são melhores quando um locutor lê seu próprio idioma nativo, portanto, uma predefinição em inglês lendo japonês pode soar com sotaque.
  • Texto de entrada ruidoso ou incomum, como marcação pesada ou símbolos mistos, pode reduzir a qualidade da saída.

Primeiros passos

  1. Criar chave de API

    Crie uma chave no Console e use com qualquer modelo da plataforma.

  2. Envie sua primeira requisição

    Copie o exemplo para sua linguagem e execute-o no endpoint.

    Texto para falaEndpoint do TokenLab
    POST/v1/audio/speech
    curl -X POST "https://api.tokenlab.sh/v1/audio/speech" \
      -H "Authorization: Bearer sk-xxx" \
      -H "Content-Type: application/json" \
      -d '{
      "operation": "tts",
      "model": "qwen3-tts-1-7b-customvoice",
      "input": "Hello from TokenLab.",
      "voice": "alloy"
    }'

Preço

O preço oficial é a base pública do criador do modelo. O preço TokenLab é o que você paga por este modelo na TokenLab.

Texto para fala

Por milhão de caracteres
Preço oficial
$0.000015
Official
$0.000015
Desconto
—

Uso e atividade

A taxa de sucesso é a proporção de requisições concluídas. A latência é quanto tempo uma resposta completa leva; P95 significa que 95% das requisições terminaram dentro desse tempo.

Uso e disponibilidade

Últimas 24 horas
Requisições
Taxa de sucesso
Latência P95
Total de tokens
Desempenho do modelo
As métricas aparecerão assim que os limites de privacidade e volume de dados forem atingidos.

Os dados baseiam-se em solicitações agregadas de usuários, excluindo verificações de status.

Abrir no Console

Abra Qwen3-TTS 1.7B CustomVoice no Console com um prompt pronto para editar ou enviar.

Ajude-me a testar qwen3-tts-1-7b-customvoice com uma solicitação de áudio em /v1/audio/speech. Exiba o resultado e custo.

Casos de uso

  • Assistentes de voz

    Dê a um assistente no aplicativo uma voz nomeada estável e baixo atraso de resposta para que as respostas comecem a ser reproduzidas rapidamente após o texto estar pronto.

  • Narração de audiolivros e artigos

    Leia textos longos com um locutor escolhido e adicione uma instrução como calma e calorosa para manter a entrega consistente entre os capítulos.

  • Vídeos de produtos localizados

    Use as predefinições em japonês, coreano ou inglês para dublar o mesmo roteiro por mercado, enquanto a marca mantém um som reconhecível.

  • Linhas de jogos e personagens

    Escolha predefinições distintas para diferentes personagens e adicione instruções de emoção para falas irritadas, cansadas ou animadas.

Exemplos de prompt

Locutor: Ryan. Instrução: calmo, amigável, ligeiramente lento. Texto: Welcome back. Your order has shipped and should arrive on Thursday.

Locutor: Ono_Anna. Instrução: locutora alegre. Texto: 本日はご来店いただき、ありがとうございます。

Locutor: Vivian. Instrução: sussurro, como se contasse um segredo. Texto: 你听说了吗?明天会有一个大消息。

FAQ

Quais vozes o Qwen3-TTS CustomVoice oferece?

Nove predefinições: Vivian, Serena, Uncle_Fu, Dylan e Eric para variantes de chinês, Ryan e Aiden para inglês, Ono_Anna para japonês e Sohee para coreano. Você escolhe uma pelo nome para cada solicitação.

Posso controlar a emoção e o estilo de fala?

Sim. Você pode adicionar uma instrução em linguagem natural, por exemplo, irritado, gentil ou rápido e animado, e o modelo ajusta o tom e a maneira enquanto mantém o timbre do locutor selecionado.

Como o CustomVoice é diferente do VoiceDesign?

O CustomVoice usa nove locutores fixos que você seleciona. O VoiceDesign não possui uma lista predefinida; você descreve a voz que deseja em palavras, como idade, humor e prosódia, e o modelo a cria. Escolha o CustomVoice para consistência e o VoiceDesign para novas vozes.

Quais idiomas ele fala?

Dez: chinês, inglês, japonês, coreano, alemão, francês, russo, português, espanhol e italiano. O cartão do modelo recomenda usar cada locutor em seu idioma nativo para obter a melhor qualidade.

É rápido o suficiente para conversas ao vivo?

A Alibaba afirma que a latência de síntese de ponta a ponta é de apenas 97 ms, visando o uso em tempo real. O atraso real em seu aplicativo também depende da distância da rede e do comprimento do texto, portanto, meça-o com seu próprio tráfego.

Quanto custa o Qwen3-TTS 1.7B CustomVoice?

No TokenLab, Qwen3-TTS 1.7B CustomVoice custa - . A tabela de preços acima mostra o detalhamento completo. As tarifas dependem da unidade de cobrança, da especificação e do uso. Compare condições iguais no preço detalhado do modelo; uma única tarifa não determina o custo total.

Qual endpoint o Qwen3-TTS 1.7B CustomVoice deve usar?

Use https://api.tokenlab.sh/v1/audio/speech para Qwen3-TTS 1.7B CustomVoice. O exemplo de requisição abaixo mostra o formato de código correspondente.

Quais operações o Qwen3-TTS 1.7B CustomVoice suporta?

Qwen3-TTS 1.7B CustomVoice suporta Texto para fala. Selecione uma operação acima para ver seu endpoint e exemplo de requisição.

Comparar Qwen3-TTS 1.7B CustomVoice

Fontes

Revisado em 2 de out. de 2026

Mais da série Qwen TTS

Modelos relacionados