xAI: Grok Voice TTS
grok-voice-tts- Masukan / Keluaran
- $15.00 / $0.00
- Modalitas
- Audio
Tentang Grok Voice TTS
Grok Voice TTS adalah model text-to-speech xAI, yang merender teks tertulis menjadi audio lisan dalam suara dan bahasa yang dipilih. Tag inline seperti jeda, tawa, dan bisikan membentuk penyampaian. Gunakan untuk narasi, notifikasi lisan, dan jawaban audio terlokalisasi di mana teks sudah ditulis dan tidak diperlukan percakapan langsung.
Kelebihan
- Tag ucapan inline seperti [pause] dan [laugh], ditambah tag pembungkus seperti whisper, memberikan kontrol penyampaian di dalam teks itu sendiri.
- Semua suara bawaan berbicara dalam bahasa yang didukung, sehingga satu identitas suara dapat digunakan di seluruh versi konten yang sama yang telah dilokalisasi.
- Suara kustom dapat dikloning dari klip referensi singkat untuk suara merek atau karakter.
- Stempel waktu tingkat karakter dapat dikembalikan untuk menyinkronkan teks atau gerakan bibir dengan audio.
Kapan harus beralih
- Model ini mengucapkan teks tetap; penelepon yang memotong atau membalas memerlukan model suara percakapan sebagai gantinya.
- Kualitas output untuk naskah panjang bergantung pada tanda baca dan tag dalam teks sumber, sehingga teks mesin yang tidak diedit bisa terdengar datar.
Memulai
Buat API key
Buat kunci di Console, gunakan untuk semua model di platform.
Kirim permintaan pertama Anda
Salin contoh untuk bahasa Anda dan jalankan terhadap endpoint tersebut.
Teks ke suaraEndpoint TokenLabPOST/v1/audio/speechcurl -X POST "https://api.tokenlab.sh/v1/audio/speech" \ -H "Authorization: Bearer sk-xxx" \ -H "Content-Type: application/json" \ -d '{ "language_code": "en", "operation": "tts", "response_format": "mp3", "voice": "eve", "model": "grok-voice-tts", "input": "Hello from TokenLab." }'
Penetapan Harga
Harga Official adalah baseline publik pembuat model. Harga TokenLab adalah yang Anda bayar untuk model ini di TokenLab.
Penetapan Harga
Per 1 juta karakter- Official
- Masukan$15.00/1 jt karakterKeluaran$0.00/1 jt karakter
- Harga Official
- Masukan$15.00/1 jt karakterKeluaran$0.00/1 jt karakter
| Harga OfficialPer 1 juta karakter | OfficialPer 1 juta karakter | Diskon | |
|---|---|---|---|
| Masukan | $15.00 | $15.00 | — |
| Keluaran | $0.00 | $0.00 | — |
Penggunaan & aktivitas
Tingkat keberhasilan adalah proporsi permintaan yang selesai. Latensi adalah berapa lama respons penuh berlangsung; P95 berarti 95% permintaan selesai dalam waktu tersebut.
Penggunaan & ketersediaan
24 jam terakhir- Permintaan
- Tingkat keberhasilan
- Latensi P95
- Total token
Data didasarkan pada permintaan pengguna gabungan, tidak termasuk pemeriksaan status.
Buka di Console
Buka Grok Voice TTS di Console dengan prompt siap diedit atau dikirim.
Bantu saya mencoba grok-voice-tts dengan permintaan audio singkat di /v1/audio/speech. Tampilkan hasil dan biayanya.
Skenario penggunaan
Artikel dan pelajaran yang dinarasikan
Ubah artikel atau naskah kursus yang sudah selesai menjadi trek audio, menggunakan jeda untuk memisahkan bagian.
Peringatan lisan
Bacakan pembaruan pesanan atau pemberitahuan keselamatan dalam bahasa pengguna melalui codec telepon.
Video produk terlokalisasi
Suarakan naskah yang sama dalam beberapa bahasa dengan satu suara pilihan, lalu gunakan stempel waktu untuk menyelaraskan teks.
Contoh prompt
Bacakan paragraf ini dengan suara yang hangat dan stabil, lalu tambahkan [pause] singkat setelah setiap kalimat.
Ucapkan pemberitahuan berikut dalam bahasa Prancis, lalu ulangi dalam bahasa Jerman, menggunakan suara yang sama.
<whisper>Paket Anda telah dikirim.</whisper> [pause] Paket tersebut akan tiba pada hari Kamis.
FAQ
Apa yang dilakukan Grok Voice TTS?
Model ini mengubah teks menjadi audio ucapan. Anda memilih suara, opsional kode bahasa, dan format output, lalu model mengembalikan audio untuk teks tersebut, termasuk tag ekspresif apa pun yang Anda tulis secara inline.
Format audio apa saja yang dapat dihasilkannya?
MP3, WAV, dan PCM mentah, ditambah codec telepon mu-law dan A-law, pada sample rate dari 8 kHz hingga 48 kHz. Codec telepon cocok untuk sistem telepon; MP3 cocok untuk pemutaran web dan seluler.
Berapa banyak bahasa yang bisa diucapkannya?
xAI mendokumentasikan dua puluh bahasa yang dipilih berdasarkan kode BCP-47, dengan deteksi bahasa otomatis sebagai alternatif. Setiap suara bawaan dapat berbicara dalam semua bahasa yang didukung, sehingga mengganti bahasa tidak memerlukan suara baru.
Bisakah saya melakukan streaming audio saat teks masih masuk?
Ya. Endpoint WebSocket menghasilkan audio secara real time saat teks dikirim, yang membantu ketika model lain masih menulis balasan yang akan diucapkan.
Bisakah saya memperbaiki kata yang salah diucapkan?
Ya. Penggantian pelafalan memungkinkan Anda memetakan istilah tertulis ke cara pengucapannya, sehingga nama merek dan akronim terdengar benar tanpa mengedit teks yang ditampilkan.
Berapa biaya Grok Voice TTS?
Di TokenLab, Grok Voice TTS dikenakan Masukan $15.00 / Keluaran $0.00 Per 1 juta karakter. Tabel harga di atas menampilkan rincian lengkap.
Endpoint mana yang harus digunakan Grok Voice TTS?
Pakai https://api.tokenlab.sh/v1/audio/speech sebagai default untuk Grok Voice TTS. Jika format native penyedia didukung, API workbench juga menampilkan endpoint tersebut.
Operasi apa saja yang didukung Grok Voice TTS?
Grok Voice TTS mendukung Teks ke suara. Pilih operasi di API workbench di atas untuk melihat endpoint dan contoh kode terkait.
Bandingkan Grok Voice TTS
Sumber
Ditinjau 2 Okt 2026