Pilih Auto, TokenLab Verified, atau Official untuk setiap permintaan, dengan harga yang ditampilkan di awal.Lihat yang baru

Alibaba: Qwen3-TTS 1.7B VoiceDesign

Qwen3-TTS 1.7B VoiceDesign adalah model text-to-speech dari Alibaba yang menciptakan suara kustom dari deskripsi bahasa alami yang menentukan emosi, nada, dan prosodi. Model ini mendukung kloning suara dari sampel audio 3 detik, menghasilkan ucapan dalam 10+ bahasa termasuk bahasa Mandarin, Inggris, Jepang, Korea, dan bahasa Eropa, serta mencapai latensi serendah 97ms.
Bandingkan model
qwen3-tts-1-7b-voicedesign
TersediaAlibabaTeks ke suaraSinkronkan
Harga
Mulai dari $0.000015
Modalitas
Audio

Tentang Qwen3-TTS 1.7B VoiceDesign

Qwen3-TTS 1.7B VoiceDesign adalah varian text-to-speech Alibaba yang menciptakan suara dari deskripsi tertulis, bukan dari daftar prasetel. Anda mendeskripsikan emosi, nada, dan prosodi dalam bahasa alami, dan model akan mengucapkan teks tersebut dengan suara itu. Model ini mencakup sepuluh bahasa dan ditujukan untuk kasus di mana tidak ada penutur yang ada yang cocok dengan karakter atau merek yang Anda inginkan.

Kelebihan

  • Suara ditentukan oleh deskripsi, seperti narator lansia dengan penyampaian yang lambat dan hangat, alih-alih dipilih dari daftar tetap.
  • Timbre, emosi, dan prosodi semuanya dapat diarahkan melalui instruksi, termasuk suasana hati yang kuat seperti kemarahan.
  • Sepuluh bahasa dicakup: Mandarin, Inggris, Jepang, Korea, Jerman, Prancis, Rusia, Portugis, Spanyol, dan Italia, ditambah varian dialek.
  • Alibaba mencantumkan latensi sintesis rendah sekitar 97 ms untuk keluarga Qwen3-TTS, sehingga cocok untuk penggunaan interaktif.

Kapan harus beralih

  • Deskripsi yang sama dapat menghasilkan suara yang sedikit berbeda pada panggilan yang berbeda, jadi ini adalah pilihan yang kurang tepat jika satu suara yang persis sama harus diulang selama berbulan-bulan.
  • Jika Anda menginginkan penutur bernama yang tetap, varian CustomVoice dengan sembilan prasetel lebih dapat diprediksi.
  • Kualitas bergantung pada seberapa jelas Anda mendeskripsikan suara tersebut; deskripsi yang samar memberikan hasil yang umum.

Memulai

  1. Buat API key

    Buat kunci di Console, gunakan untuk semua model di platform.

  2. Kirim permintaan pertama Anda

    Salin contoh untuk bahasa Anda dan jalankan terhadap endpoint tersebut.

    Teks ke suaraEndpoint TokenLab
    POST/v1/audio/speech
    curl -X POST "https://api.tokenlab.sh/v1/audio/speech" \
      -H "Authorization: Bearer sk-xxx" \
      -H "Content-Type: application/json" \
      -d '{
      "operation": "tts",
      "model": "qwen3-tts-1-7b-voicedesign",
      "input": "Hello from TokenLab.",
      "voice": "alloy"
    }'

Penetapan Harga

Harga Official adalah baseline publik pembuat model. Harga TokenLab adalah yang Anda bayar untuk model ini di TokenLab.

Teks ke suara

Per 1 juta karakter
Harga Official
$0.000015
Official
$0.000015
Diskon
—

Penggunaan & aktivitas

Tingkat keberhasilan adalah proporsi permintaan yang selesai. Latensi adalah berapa lama respons penuh berlangsung; P95 berarti 95% permintaan selesai dalam waktu tersebut.

Penggunaan & ketersediaan

24 jam terakhir
Permintaan
Tingkat keberhasilan
Latensi P95
Total token
Performa model
Metrik akan muncul setelah ambang batas privasi dan volume data terpenuhi.

Data didasarkan pada permintaan pengguna gabungan, tidak termasuk pemeriksaan status.

Buka di Console

Buka Qwen3-TTS 1.7B VoiceDesign di Console dengan prompt siap diedit atau dikirim.

Bantu saya mencoba qwen3-tts-1-7b-voicedesign dengan permintaan audio singkat di /v1/audio/speech. Tampilkan hasil dan biayanya.

Skenario penggunaan

  • Suara karakter untuk game

    Deskripsikan setiap karakter, misalnya pandai besi kurcaci yang kasar atau kurir muda yang gugup, dan buat dialog tanpa harus merekrut pengisi suara terlebih dahulu.

  • Eksplorasi suara merek

    Coba beberapa deskripsi suara perusahaan, seperti percaya diri dan rendah versus ceria dan cepat, lalu bandingkan pada naskah yang sama.

  • Narasi ekspresif

    Penyampaian langsung untuk bagian cerita dengan instruksi seperti tenang dan tegang, lalu lega dan hangat, dalam satu proyek.

  • Prototipe suara untuk video

    Buat narator sementara untuk papan cerita atau video penjelasan sebelum pengisi suara final dipilih.

Contoh prompt

Suara: seorang wanita paruh baya, tenang dan rendah, berbicara perlahan seperti narator dokumenter. Teks: The river has changed course three times in the last century.

Suara: seorang pria muda, bersemangat dan sedikit terengah-engah, tempo cepat. Teks: You will not believe what just came through the door.

Suara: berbicara dengan nada yang sangat marah, cepat dan terputus-putus (用特别愤怒的语气说). Teks: 这已经是第三次了,你们到底有没有在听?

FAQ

Untuk apa Qwen3-TTS VoiceDesign digunakan?

Model ini menghasilkan ucapan dengan suara yang Anda tentukan melalui kata-kata. Alih-alih memilih penutur bernama, Anda menulis deskripsi yang mencakup emosi, nada, dan penyampaian, lalu model menghasilkan audio yang mengikutinya. Ini cocok untuk karakter dan suara merek yang tidak cocok dengan prasetel standar.

Apa perbedaannya dengan CustomVoice?

CustomVoice menawarkan sembilan penutur bernama tetap dengan instruksi gaya opsional. VoiceDesign tidak memiliki daftar tetap dan membangun suara dari deskripsi Anda. Pilih VoiceDesign untuk menciptakan sesuatu yang baru dan CustomVoice untuk penutur yang stabil dan dapat diulang.

Bahasa apa saja yang didukung?

Sepuluh: Mandarin, Inggris, Jepang, Korea, Jerman, Prancis, Rusia, Portugis, Spanyol, dan Italia, beserta beberapa varian dialek. Tulis deskripsi suara dalam bahasa yang dipahami model; contoh pada kartu model menggunakan bahasa Mandarin.

Bisakah saya mengkloning suara orang sungguhan dengannya?

Keluarga Qwen3-TTS menjelaskan kloning suara dari sampel pendek, tetapi fokus varian ini adalah desain berbasis instruksi. Hanya kloning atau tiru suara yang memiliki izin untuk Anda gunakan, dan periksa output terhadap aturan persetujuan Anda sendiri.

Apakah suaranya akan identik pada setiap panggilan?

Tidak dijamin. Deskripsi mengarahkan suara tetapi tidak mengunci satu timbre yang persis sama, sehingga panggilan berulang dapat terdengar sedikit berbeda. Jika Anda memerlukan pengulangan yang tepat di sepanjang proyek yang panjang, gunakan penutur prasetel tetap sebagai gantinya.

Berapa biaya Qwen3-TTS 1.7B VoiceDesign?

Di TokenLab, Qwen3-TTS 1.7B VoiceDesign dikenakan - . Tabel harga di atas menampilkan rincian lengkap. Tarif bergantung pada unit penagihan, spesifikasi, dan penggunaan. Bandingkan kondisi yang sama dalam harga detail model; satu tarif tidak menentukan total biaya.

Endpoint mana yang harus digunakan Qwen3-TTS 1.7B VoiceDesign?

Pakai https://api.tokenlab.sh/v1/audio/speech sebagai default untuk Qwen3-TTS 1.7B VoiceDesign. Jika format native penyedia didukung, API workbench juga menampilkan endpoint tersebut.

Operasi apa saja yang didukung Qwen3-TTS 1.7B VoiceDesign?

Qwen3-TTS 1.7B VoiceDesign mendukung Teks ke suara. Pilih operasi di API workbench di atas untuk melihat endpoint dan contoh kode terkait.

Bandingkan Qwen3-TTS 1.7B VoiceDesign

Sumber

Ditinjau 2 Okt 2026

Lainnya dari Qwen TTS

Model terkait