Pilih Auto, TokenLab Verified, atau Official untuk setiap permintaan, dengan harga yang ditampilkan di awal.Lihat yang baru

xAI: Grok Voice TTS

Grok Voice TTS membuat ucapan dari teks tertulis dengan suara dan bahasa yang dipilih. Model ini cocok untuk narasi lokal, pemberitahuan lisan, dan aplikasi yang perlu merender teks yang disiapkan sebagai respons audio.
Bandingkan model
grok-voice-tts
TersediaxAITeks ke suaraSinkronkan
Masukan / Keluaran
$15.00 / $0.00
Modalitas
Audio

Tentang Grok Voice TTS

Grok Voice TTS adalah model text-to-speech xAI, yang merender teks tertulis menjadi audio lisan dalam suara dan bahasa yang dipilih. Tag inline seperti jeda, tawa, dan bisikan membentuk penyampaian. Gunakan untuk narasi, notifikasi lisan, dan jawaban audio terlokalisasi di mana teks sudah ditulis dan tidak diperlukan percakapan langsung.

Kelebihan

  • Tag ucapan inline seperti [pause] dan [laugh], ditambah tag pembungkus seperti whisper, memberikan kontrol penyampaian di dalam teks itu sendiri.
  • Semua suara bawaan berbicara dalam bahasa yang didukung, sehingga satu identitas suara dapat digunakan di seluruh versi konten yang sama yang telah dilokalisasi.
  • Suara kustom dapat dikloning dari klip referensi singkat untuk suara merek atau karakter.
  • Stempel waktu tingkat karakter dapat dikembalikan untuk menyinkronkan teks atau gerakan bibir dengan audio.

Kapan harus beralih

  • Model ini mengucapkan teks tetap; penelepon yang memotong atau membalas memerlukan model suara percakapan sebagai gantinya.
  • Kualitas output untuk naskah panjang bergantung pada tanda baca dan tag dalam teks sumber, sehingga teks mesin yang tidak diedit bisa terdengar datar.

Memulai

  1. Buat API key

    Buat kunci di Console, gunakan untuk semua model di platform.

  2. Kirim permintaan pertama Anda

    Salin contoh untuk bahasa Anda dan jalankan terhadap endpoint tersebut.

    Teks ke suaraEndpoint TokenLab
    POST/v1/audio/speech
    curl -X POST "https://api.tokenlab.sh/v1/audio/speech" \
      -H "Authorization: Bearer sk-xxx" \
      -H "Content-Type: application/json" \
      -d '{
      "language_code": "en",
      "operation": "tts",
      "response_format": "mp3",
      "voice": "eve",
      "model": "grok-voice-tts",
      "input": "Hello from TokenLab."
    }'

Penetapan Harga

Harga Official adalah baseline publik pembuat model. Harga TokenLab adalah yang Anda bayar untuk model ini di TokenLab.

Penetapan Harga

Per 1 juta karakter
Official
Masukan$15.00/1 jt karakterKeluaran$0.00/1 jt karakter
Harga Official
Masukan$15.00/1 jt karakterKeluaran$0.00/1 jt karakter

Penggunaan & aktivitas

Tingkat keberhasilan adalah proporsi permintaan yang selesai. Latensi adalah berapa lama respons penuh berlangsung; P95 berarti 95% permintaan selesai dalam waktu tersebut.

Penggunaan & ketersediaan

24 jam terakhir
Permintaan
Tingkat keberhasilan
Latensi P95
Total token
Performa model
Metrik akan muncul setelah ambang batas privasi dan volume data terpenuhi.

Data didasarkan pada permintaan pengguna gabungan, tidak termasuk pemeriksaan status.

Buka di Console

Buka Grok Voice TTS di Console dengan prompt siap diedit atau dikirim.

Bantu saya mencoba grok-voice-tts dengan permintaan audio singkat di /v1/audio/speech. Tampilkan hasil dan biayanya.

Skenario penggunaan

  • Artikel dan pelajaran yang dinarasikan

    Ubah artikel atau naskah kursus yang sudah selesai menjadi trek audio, menggunakan jeda untuk memisahkan bagian.

  • Peringatan lisan

    Bacakan pembaruan pesanan atau pemberitahuan keselamatan dalam bahasa pengguna melalui codec telepon.

  • Video produk terlokalisasi

    Suarakan naskah yang sama dalam beberapa bahasa dengan satu suara pilihan, lalu gunakan stempel waktu untuk menyelaraskan teks.

Contoh prompt

Bacakan paragraf ini dengan suara yang hangat dan stabil, lalu tambahkan [pause] singkat setelah setiap kalimat.

Ucapkan pemberitahuan berikut dalam bahasa Prancis, lalu ulangi dalam bahasa Jerman, menggunakan suara yang sama.

<whisper>Paket Anda telah dikirim.</whisper> [pause] Paket tersebut akan tiba pada hari Kamis.

FAQ

Apa yang dilakukan Grok Voice TTS?

Model ini mengubah teks menjadi audio ucapan. Anda memilih suara, opsional kode bahasa, dan format output, lalu model mengembalikan audio untuk teks tersebut, termasuk tag ekspresif apa pun yang Anda tulis secara inline.

Format audio apa saja yang dapat dihasilkannya?

MP3, WAV, dan PCM mentah, ditambah codec telepon mu-law dan A-law, pada sample rate dari 8 kHz hingga 48 kHz. Codec telepon cocok untuk sistem telepon; MP3 cocok untuk pemutaran web dan seluler.

Berapa banyak bahasa yang bisa diucapkannya?

xAI mendokumentasikan dua puluh bahasa yang dipilih berdasarkan kode BCP-47, dengan deteksi bahasa otomatis sebagai alternatif. Setiap suara bawaan dapat berbicara dalam semua bahasa yang didukung, sehingga mengganti bahasa tidak memerlukan suara baru.

Bisakah saya melakukan streaming audio saat teks masih masuk?

Ya. Endpoint WebSocket menghasilkan audio secara real time saat teks dikirim, yang membantu ketika model lain masih menulis balasan yang akan diucapkan.

Bisakah saya memperbaiki kata yang salah diucapkan?

Ya. Penggantian pelafalan memungkinkan Anda memetakan istilah tertulis ke cara pengucapannya, sehingga nama merek dan akronim terdengar benar tanpa mengedit teks yang ditampilkan.

Berapa biaya Grok Voice TTS?

Di TokenLab, Grok Voice TTS dikenakan Masukan $15.00 / Keluaran $0.00 Per 1 juta karakter. Tabel harga di atas menampilkan rincian lengkap.

Endpoint mana yang harus digunakan Grok Voice TTS?

Pakai https://api.tokenlab.sh/v1/audio/speech sebagai default untuk Grok Voice TTS. Jika format native penyedia didukung, API workbench juga menampilkan endpoint tersebut.

Operasi apa saja yang didukung Grok Voice TTS?

Grok Voice TTS mendukung Teks ke suara. Pilih operasi di API workbench di atas untuk melihat endpoint dan contoh kode terkait.

Bandingkan Grok Voice TTS

Sumber

Ditinjau 2 Okt 2026

Lainnya dari Grok Voice

Model terkait