xAI: Grok Voice Think Fast 2.0
grok-voice-think-fast-2.0- Harga
- Mulai dari $0.001333
- Modalitas
- Audio
Tentang Grok Voice Think Fast 2.0
Grok Voice Think Fast 2.0 adalah model suara real-time dari xAI untuk percakapan dua arah secara langsung, yang dirancang bagi asisten yang harus mengimbangi pembicara alih-alih membaca naskah yang disiapkan. Ini adalah model berversi di balik alias grok-voice-latest. Gunakan ID persis ini jika produk memerlukan versi model tetap untuk balasan lisannya.
Kelebihan
- Ini adalah rilis tetap dan berversi di balik alias agen suara xAI, sehingga perilaku tetap terikat pada satu model sampai Anda beralih darinya.
- Deteksi aktivitas suara di sisi server mengelola giliran bicara, sehingga klien melakukan streaming audio mikrofon tanpa logika jeda sendiri.
- Instruksi per-respons memungkinkan sesi mengubah perintah sistem untuk satu balasan, misalnya untuk mengubah nada saat menjelaskan pengembalian dana.
- Penggantian pelafalan mengoreksi cara nama dan istilah produk diucapkan tanpa mengubah transkrip.
Kapan harus beralih
- Ini adalah model percakapan speech-to-speech, sehingga transkripsi batch file dan narasi teks panjang lebih baik dilayani oleh model ucapan khusus.
- Menjaga koneksi tetap terbuka untuk audio langsung memerlukan klien WebSocket; panggilan permintaan dan respons biasa tidak akan menjalankannya.
Memulai
Buat API key
Buat kunci di Console, gunakan untuk semua model di platform.
Kirim permintaan pertama Anda
Salin contoh untuk bahasa Anda dan jalankan terhadap endpoint tersebut.
AudioChat Completions APIPOST/v1/chat/completionscurl https://api.tokenlab.sh/v1/chat/completions \ -H "Content-Type: application/json" \ -H "Authorization: Bearer sk-xxx" \ -d '{ "model": "grok-voice-think-fast-2.0", "messages": [ {"role": "user", "content": "Hello!"} ] }'
Penetapan Harga
Harga Official adalah baseline publik pembuat model. Harga TokenLab adalah yang Anda bayar untuk model ini di TokenLab.
Audio Duration
per detik- Harga Official
- $0.001333
- Official
- $0.001333
- Diskon
- —
| Harga Officialper detik | Officialper detik | Diskon | |
|---|---|---|---|
| Audio Duration | $0.001333 | $0.001333 | — |
Penggunaan & aktivitas
Tingkat keberhasilan adalah proporsi permintaan yang selesai. Latensi adalah berapa lama respons penuh berlangsung; P95 berarti 95% permintaan selesai dalam waktu tersebut.
Penggunaan & ketersediaan
24 jam terakhir- Permintaan
- Tingkat keberhasilan
- Latensi P95
- Total token
Data didasarkan pada permintaan pengguna gabungan, tidak termasuk pemeriksaan status.
Skenario penggunaan
Pengganti respons suara interaktif
Ganti sistem menu telepon dengan penelepon yang cukup menyatakan masalahnya, sementara agen mengalihkan panggilan atau menyelesaikannya.
Mitra latihan bahasa
Lakukan dialog lisan dalam bahasa target, mengoreksi kesalahan dengan suara keras dan menyesuaikan kecepatan saat pelajar memintanya.
Asisten lapangan hands-free
Biarkan teknisi mengajukan pertanyaan tentang manual melalui suara dan mendengar jawaban sementara kedua tangan tetap memegang peralatan.
Contoh prompt
Anda adalah agen dukungan yang tenang untuk penyedia internet. Mintalah kode pos akun, lalu pandu penelepon untuk memulai ulang router.
Ucapkan merek kami 'Zyntra' sebagai ZIN-tra, jaga nada bicara yang ramah, dan jangan pernah memotong pembicaraan penelepon di tengah kalimat.
Bertindaklah sebagai tutor bahasa Portugis. Bicaralah dengan lambat, ulangi kalimat saya yang telah dikoreksi, dan ajukan satu pertanyaan tindak lanjut setiap giliran.
FAQ
Apa perbedaan antara grok-voice-think-fast-2.0 dan grok-voice-latest?
grok-voice-think-fast-2.0 adalah versi model spesifik, sedangkan grok-voice-latest adalah alias yang saat ini mengarah ke versi tersebut. Alias akan berpindah ke rilis yang lebih baru; nama dengan tanggal tetap pada versi yang Anda uji.
Apakah Grok Voice Think Fast 2.0 merupakan model text-to-speech?
Bukan. Model ini mendengarkan dan menjawab dalam sesi langsung, menerima input audio dan menghasilkan balasan lisan. Untuk mengubah teks yang disiapkan menjadi audio, gunakan Grok Voice TTS; untuk mentranskripsikan rekaman, gunakan Grok Voice STT.
Bagaimana cara model memutuskan kapan saya selesai berbicara?
Sesi dapat mengaktifkan deteksi aktivitas suara di sisi server, yang mendeteksi akhir giliran pengguna dan memulai balasan. Anda juga dapat mengelola giliran bicara sendiri jika klien Anda sudah memiliki fitur push-to-talk.
Suara apa saja yang bisa digunakannya?
Sesi dapat memilih di antara suara bawaan xAI, dengan eve sebagai default, atau suara kustom yang dikloning dari rekaman referensi singkat. Suara bawaan dapat berbicara dalam semua bahasa yang didukung.
Berapa biaya Grok Voice Think Fast 2.0?
Di TokenLab, Grok Voice Think Fast 2.0 dikenakan $0.001333 per detik. Tabel harga di atas menampilkan rincian lengkap. Tarif bergantung pada unit penagihan, spesifikasi, dan penggunaan. Bandingkan kondisi yang sama dalam harga detail model; satu tarif tidak menentukan total biaya.
Endpoint mana yang harus digunakan Grok Voice Think Fast 2.0?
Pakai https://api.tokenlab.sh/v1/chat/completions sebagai default untuk Grok Voice Think Fast 2.0. Jika format native penyedia didukung, API workbench juga menampilkan endpoint tersebut.
Bandingkan Grok Voice Think Fast 2.0
Sumber
Ditinjau 2 Okt 2026