xAI: Grok Voice STT
grok-voice-stt- Harga
- Mulai dari $0.000028
- Modalitas
- Audio
Tentang Grok Voice STT
Grok Voice STT adalah model speech-to-text xAI, yang mengubah audio rekaman atau streaming menjadi transkrip teks. Model ini menerima format file audio umum, mengembalikan stempel waktu tingkat kata, dapat memisahkan pembicara dan saluran, serta memformat angka dan mata uang berdasarkan bahasa. Gunakan untuk teks (caption), catatan rapat yang dapat dicari, dan transkrip panggilan yang menjadi input untuk analisis teks selanjutnya.
Kelebihan
- Stempel waktu tingkat kata memudahkan pembuatan teks (caption), pencarian lompat-ke-momen, dan file subtitle dari transkrip.
- Diarisasi pembicara dan transkripsi multisaluran memisahkan siapa yang berbicara dalam rapat dan rekaman panggilan dua arah.
- Petunjuk bahasa dan daftar istilah kunci kustom mengarahkan pengenalan ke nama produk dan jargon.
- Pemformatan teks merender angka, tanggal, dan mata uang sesuai cara penulisan bahasa lisan tersebut.
Kapan harus beralih
- Ini hanya menghasilkan transkrip; meringkas, menerjemahkan, atau menjawab dari audio memerlukan model teks setelahnya.
- Rekaman yang sangat bising mungkin memerlukan penyesuaian ambang batas deteksi suara atau input yang lebih bersih agar akurasinya dapat diterima.
Memulai
Buat API key
Buat kunci di Console, gunakan untuk semua model di platform.
Kirim permintaan pertama Anda
Salin contoh untuk bahasa Anda dan jalankan terhadap endpoint tersebut.
Suara ke teksEndpoint TokenLabPOST/v1/audio/transcriptionscurl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \ -H "Authorization: Bearer sk-xxx" \ -F file="@audio.mp3" \ -F operation="stt" \ -F response_format="json" \ -F model="grok-voice-stt" \ -F language="en"
Penetapan Harga
Harga Official adalah baseline publik pembuat model. Harga TokenLab adalah yang Anda bayar untuk model ini di TokenLab.
Penetapan Harga
per detik- Official
- $0.000028per detik
- Harga Official
- $0.000028per detik
| Harga Officialper detik | Officialper detik | Diskon | |
|---|---|---|---|
| Harga | $0.000028per detik | $0.000028per detik | — |
Penggunaan & aktivitas
Tingkat keberhasilan adalah proporsi permintaan yang selesai. Latensi adalah berapa lama respons penuh berlangsung; P95 berarti 95% permintaan selesai dalam waktu tersebut.
Penggunaan & ketersediaan
24 jam terakhir- Permintaan
- Tingkat keberhasilan
- Latensi P95
- Total token
Data didasarkan pada permintaan pengguna gabungan, tidak termasuk pemeriksaan status.
Buka di Console
Buka Grok Voice STT di Console dengan prompt siap diedit atau dikirim.
Bantu saya mencoba grok-voice-stt dengan permintaan audio singkat di /v1/audio/transcriptions. Tampilkan hasil dan biayanya.
Skenario penggunaan
Transkrip rapat
Mentranskripsikan panggilan yang direkam dengan pelabelan pembicara, lalu teruskan teks ke peringkas untuk poin-poin tindakan.
Subtitle untuk video
Hasilkan teks (caption) berwaktu dari trek audio video yang diunggah menggunakan pengaturan waktu kata.
Tinjauan kualitas pusat panggilan
Mentranskripsikan rekaman dua saluran dengan agen dan pelanggan pada saluran terpisah, lalu pindai untuk mencari frasa kepatuhan.
Contoh prompt
Mentranskripsikan episode podcast 45 menit ini dalam bahasa Inggris dengan stempel waktu kata dan pelabelan pembicara.
Mentranskripsikan panggilan pelanggan yang dilampirkan, menggunakan istilah kunci 'Zyntra', 'OmniPlan', dan 'SLA' untuk memengaruhi pengenalan.
Konversikan memo suara bahasa Spanyol ini menjadi teks dan format jumlahnya sebagai mata uang.
FAQ
Apa yang dilakukan Grok Voice STT?
Ini mengubah audio menjadi teks. Anda mengirim file atau streaming audio, dan model ini mengembalikan transkrip yang dapat menyertakan stempel waktu tingkat kata, label pembicara, dan teks per saluran, tergantung pada opsi yang Anda tetapkan.
Format audio apa yang dapat dibacanya?
xAI mencantumkan dua belas format, termasuk MP3, WAV, FLAC, dan Opus, dengan batas ukuran file 500 MB. Audio PCM mentah, mu-law, dan A-law memerlukan parameter pengodean eksplisit.
Apakah mendukung transkripsi langsung?
Ya. Endpoint WebSocket melakukan streaming hasil sementara dan menggunakan deteksi akhir giliran bicara Smart Turn untuk membedakan jeda alami dari akhir kalimat, yang mengurangi pemotongan prematur.
Berapa banyak bahasa yang dicakupnya?
xAI mendokumentasikan lebih dari 25 bahasa untuk transkripsi dan pemformatan khusus bahasa. Berikan petunjuk bahasa saat Anda mengetahui bahasanya, sehingga pengenalan tidak perlu menebak.
Bisakah model ini membedakan pembicara?
Ya, diarisasi melabeli pembicara dalam rekaman, dan mode multisaluran menangani hingga delapan saluran terpisah, yang cocok untuk rekaman panggilan dengan satu pihak per saluran.
Berapa biaya Grok Voice STT?
Di TokenLab, Grok Voice STT dikenakan $0.000028 per detik. Tabel harga di atas menampilkan rincian lengkap.
Endpoint mana yang harus digunakan Grok Voice STT?
Pakai https://api.tokenlab.sh/v1/audio/transcriptions sebagai default untuk Grok Voice STT. Jika format native penyedia didukung, API workbench juga menampilkan endpoint tersebut.
Operasi apa saja yang didukung Grok Voice STT?
Grok Voice STT mendukung Suara ke teks. Pilih operasi di API workbench di atas untuk melihat endpoint dan contoh kode terkait.
Bandingkan Grok Voice STT
Sumber
Ditinjau 2 Okt 2026