Alibaba: CosyVoice v3.5 Plus
cosyvoice-v3.5-plus- Masukan / Keluaran
- $22.06 / $0.00
- Modalitas
- Audio
Tentang CosyVoice v3.5 Plus
CosyVoice v3.5 Plus adalah model sintesis suara dari Alibaba untuk suara yang Anda buat sendiri. Model ini tidak memiliki daftar suara bawaan: Anda mengklon suara dari sampel atau merancangnya dari deskripsi teks, lalu menyintesiskannya melalui koneksi WebSocket. Model ini berbicara dalam bahasa Mandarin, Inggris, dan beberapa bahasa lainnya, ditambah banyak dialek regional Tiongkok, serta menerima instruksi berbahasa natural untuk mengarahkan pengiriman suara, yang tidak dimiliki oleh Qwen3-TTS-Flash.
Kelebihan
- Bekerja dengan suara hasil kloning dari rekaman atau suara yang dirancang dari deskripsi tertulis.
- Menerima instruksi untuk mengontrol nada dan gaya bicara.
- Berbicara dalam bahasa Mandarin, Kanton, dan banyak dialek regional Tiongkok serta bahasa Inggris, Prancis, Jerman, Jepang, Korea, Rusia, Portugis, Thai, Indonesia, dan Vietnam.
- Melakukan streaming audio melalui WebSocket, sehingga pemutaran dapat dimulai sebelum sintesis selesai.
Kapan harus beralih
- Model ini tidak memiliki suara sistem bawaan; Anda harus membuat suara hasil kloning atau rancangan terlebih dahulu.
- Model ini memerlukan klien WebSocket, bukan sekadar permintaan HTTP biasa.
- Kloning suara memerlukan sampel referensi yang bersih dan izin untuk menggunakan suara tersebut.
Memulai
Buat API key
Buat kunci di Console, gunakan untuk semua model di platform.
Kirim permintaan pertama Anda
Salin contoh untuk bahasa Anda dan jalankan terhadap endpoint tersebut.
Teks ke suaraEndpoint TokenLabPOST/v1/audio/speechcurl -X POST "https://api.tokenlab.sh/v1/audio/speech" \ -H "Authorization: Bearer sk-xxx" \ -H "Content-Type: application/json" \ -d '{ "operation": "tts", "response_format": "mp3", "speed": 1, "model": "cosyvoice-v3.5-plus", "input": "Hello from TokenLab.", "voice": "alloy" }'
Penetapan Harga
Harga Official adalah baseline publik pembuat model. Harga TokenLab adalah yang Anda bayar untuk model ini di TokenLab.
Cosy Tts Number
Per 1 juta karakter- Harga Official
- Masukan $22.06 / Keluaran $0.00
- Official
- Masukan $22.06 / Keluaran $0.00
- Diskon
- —
| Harga OfficialPer 1 juta karakter | OfficialPer 1 juta karakter | Diskon | |
|---|---|---|---|
| Cosy Tts Number | Masukan $22.06 / Keluaran $0.00 | Masukan $22.06 / Keluaran $0.00 | — |
Penggunaan & aktivitas
Tingkat keberhasilan adalah proporsi permintaan yang selesai. Latensi adalah berapa lama respons penuh berlangsung; P95 berarti 95% permintaan selesai dalam waktu tersebut.
Penggunaan & ketersediaan
24 jam terakhir- Permintaan
- Tingkat keberhasilan
- Latensi P95
- Total token
Data didasarkan pada permintaan pengguna gabungan, tidak termasuk pemeriksaan status.
Buka di Console
Buka CosyVoice v3.5 Plus di Console dengan prompt siap diedit atau dikirim.
Bantu saya mencoba cosyvoice-v3.5-plus dengan permintaan audio singkat di /v1/audio/speech. Tampilkan hasil dan biayanya.
Skenario penggunaan
Suara merek
Kloning pembicara yang disetujui sekali saja dan gunakan suara tersebut untuk tur produk, prompt IVR, dan pengumuman.
Suara karakter
Rancang suara dari sebuah deskripsi, seperti seorang pencerita berusia lebih tua yang hangat, untuk buku audio atau game.
Narasi dialek regional
Hasilkan konten lisan dalam ucapan Sichuan, Shanghai, atau Kanton untuk audiens lokal.
Contoh prompt
Baca pengumuman ini dengan nada yang cepat dan ceria, disertai jeda singkat setelah tanggal.
Ucapkan paragraf berikut secara perlahan dan hangat, seolah-olah sedang membacakan cerita pengantar tidur.
Ucapkan ini dalam bahasa Kanton dengan tempo yang santai dan bernada percakapan.
FAQ
Apakah CosyVoice v3.5 Plus memiliki suara prasetel?
Tidak. Alibaba tidak mencantumkan suara sistem untuk model ini. Anda memerlukan suara hasil kloning dari sampel atau suara rancangan dari deskripsi teks, lalu meneruskan suara tersebut saat melakukan sintesis.
Bahasa dan dialek apa saja yang didukungnya?
Mandarin, Kanton, dan banyak dialek regional Tiongkok, ditambah bahasa Inggris, Prancis, Jerman, Jepang, Korea, Rusia, Portugis, Thai, Indonesia, dan Vietnam. Dukungan dialek adalah perbedaan utama dari model Qwen3-TTS-Flash.
Bisakah saya mengontrol cara suaranya terdengar?
Ya. Model ini mendukung kontrol instruksi, sehingga Anda dapat mendeskripsikan nada, emosi, atau tempo dalam bahasa natural. Pilihan suara menentukan siapa yang berbicara; instruksi membentuk bagaimana kalimat tersebut disampaikan.
Bagaimana cara memanggilnya?
Melalui API WebSocket yang melakukan streaming audio kembali saat audio tersebut dihasilkan. Cara ini cocok untuk skrip panjang dan pemutaran langsung (live), tetapi Anda memerlukan klien yang menangani koneksi tersebut.
Kapan sebaiknya saya memilih Qwen3-TTS-Flash?
Ketika Anda menginginkan suara siap pakai dan panggilan HTTP yang sederhana serta tidak memerlukan kloning atau instruksi. Pilih CosyVoice bila identitas suara atau gaya penyampaian menjadi bagian dari produk Anda.
Berapa biaya CosyVoice v3.5 Plus?
Di TokenLab, CosyVoice v3.5 Plus dikenakan Masukan $22.06 / Keluaran $0.00 Per 1 juta karakter. Tabel harga di atas menampilkan rincian lengkap. Tarif bergantung pada unit penagihan, spesifikasi, dan penggunaan. Bandingkan kondisi yang sama dalam harga detail model; satu tarif tidak menentukan total biaya.
Endpoint mana yang harus digunakan CosyVoice v3.5 Plus?
Pakai https://api.tokenlab.sh/v1/audio/speech sebagai default untuk CosyVoice v3.5 Plus. Jika format native penyedia didukung, API workbench juga menampilkan endpoint tersebut.
Operasi apa saja yang didukung CosyVoice v3.5 Plus?
CosyVoice v3.5 Plus mendukung Teks ke suara. Pilih operasi di API workbench di atas untuk melihat endpoint dan contoh kode terkait.
Bandingkan CosyVoice v3.5 Plus
Sumber
Ditinjau 2 Okt 2026