xAI: Grok STT
grok-stt- Harga
- Mulai dari $0.000028
- Modalitas
- Audio
Tentang Grok STT
Grok STT adalah layanan speech-to-text dari xAI untuk mengubah rekaman audio menjadi teks. Model ini menangani rekaman yang diunggah dalam bentuk batch dan mengembalikan transkrip dalam format JSON. xAI mendokumentasikan dukungan untuk 25 bahasa dalam layanan transkripsinya. Transkripsi streaming real-time merupakan antarmuka xAI yang terpisah, sehingga model ini cocok untuk file yang sudah ada seperti rapat, panggilan, dan wawancara.
Kelebihan
- Mentranskripsikan file audio yang diunggah dalam satu permintaan dan mengembalikan hasil JSON.
- xAI mendokumentasikan dukungan untuk 25 bahasa, mencakup banyak rekaman multibahasa.
- Cocok untuk pekerjaan batch seperti arsip rapat, rekaman panggilan, dan tumpukan wawancara.
- Bekerja melalui format permintaan transkripsi audio standar, sehingga klien bergaya Whisper yang sudah ada hanya memerlukan sedikit perubahan.
- Rekaman panjang ditangani sebagai satu unggahan file, bukan dipecah menjadi potongan-potongan pendek.
Kapan harus beralih
- Hanya batch; teks langsung (live captioning) dan streaming latensi rendah memerlukan antarmuka real-time yang terpisah.
- Output berupa transkrip dalam JSON, tanpa fitur peringkasan atau penerjemahan bawaan.
- Akurasi bergantung pada kualitas audio, sehingga ucapan yang bising atau tumpang tindih mungkin memerlukan pembersihan atau peninjauan.
Memulai
Buat API key
Buat kunci di Console, gunakan untuk semua model di platform.
Kirim permintaan pertama Anda
Salin contoh untuk bahasa Anda dan jalankan terhadap endpoint tersebut.
Suara ke teksEndpoint TokenLabPOST/v1/audio/transcriptionscurl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \ -H "Authorization: Bearer sk-xxx" \ -F file="@audio.mp3" \ -F operation="stt" \ -F response_format="json" \ -F model="grok-stt" \ -F language="en"
Penetapan Harga
Harga Official adalah baseline publik pembuat model. Harga TokenLab adalah yang Anda bayar untuk model ini di TokenLab.
Suara ke teks
per detik- Harga Official
- $0.00002778
- Official
- $0.00002778
- Diskon
- —
| Harga Officialper detik | Officialper detik | Diskon | |
|---|---|---|---|
| Suara ke teks | $0.00002778 | $0.00002778 | — |
Penggunaan & aktivitas
Tingkat keberhasilan adalah proporsi permintaan yang selesai. Latensi adalah berapa lama respons penuh berlangsung; P95 berarti 95% permintaan selesai dalam waktu tersebut.
Penggunaan & ketersediaan
24 jam terakhir- Permintaan
- Tingkat keberhasilan
- Latensi P95
- Total token
Data didasarkan pada permintaan pengguna gabungan, tidak termasuk pemeriksaan status.
Buka di Console
Buka Grok STT di Console dengan prompt siap diedit atau dikirim.
Bantu saya mencoba grok-stt dengan permintaan audio singkat di /v1/audio/transcriptions. Tampilkan hasil dan biayanya.
Skenario penggunaan
Transkrip rapat
Unggah panggilan atau rapat yang direkam dan simpan teksnya agar tim dapat mencarinya atau memasukkannya ke model peringkasan.
Arsip wawancara dan podcast
Ubah tumpukan rekaman menjadi teks untuk penyuntingan, kutipan, dan catatan acara.
Tinjauan panggilan dukungan
Transkripsikan panggilan pelanggan secara massal agar tim kualitas dapat memindai masalah dan topik.
Contoh prompt
Transkripsikan rekaman rapat tim berdurasi 45 menit ini dalam bahasa Inggris.
Transkripsikan panggilan pelanggan yang dilampirkan. Para pembicara berbicara dalam bahasa Spanyol.
Ubah kuliah yang direkam ini menjadi teks agar saya dapat mencarinya untuk bagian tentang fotosintesis.
FAQ
Apa itu Grok STT?
Ini adalah layanan speech-to-text dari xAI. Layanan ini menerima rekaman yang diunggah dan mengembalikan transkrip sebagai JSON, bekerja dalam mode batch, bukan langsung. Gunakan untuk rekaman yang sudah Anda miliki, seperti rapat, panggilan, dan wawancara.
Bahasa apa saja yang didukungnya?
xAI mendokumentasikan 25 bahasa untuk layanan transkripsinya. Uji sampel singkat dalam bahasa Anda terlebih dahulu, karena akurasi bervariasi tergantung pada bahasa dan kualitas rekaman. Aksen juga memengaruhi hasil.
Bisakah Grok STT mentranskripsikan audio langsung?
Tidak. Model ini hanya menangani file yang diunggah, jadi gunakan setelah panggilan atau rapat berakhir. xAI menawarkan transkripsi streaming melalui antarmuka terpisah, dan teks langsung memerlukan antarmuka tersebut, bukan model ini.
Format apa yang saya dapatkan?
Respons JSON yang berisi teks transkrip. Anda dapat meneruskan teks tersebut ke model bahasa untuk ringkasan, poin tindakan, atau terjemahan ke bahasa lain.
Apa bedanya dengan Whisper?
Keduanya mentranskripsikan audio yang diunggah melalui gaya permintaan yang sama. Keduanya berbeda dalam cakupan bahasa dan akurasi berdasarkan jenis audio, jadi jalankan keduanya pada sampel rekaman Anda dan bandingkan transkripnya.
Berapa biaya Grok STT?
Di TokenLab, Grok STT dikenakan $0.00002778 per detik. Tabel harga di atas menampilkan rincian lengkap. Tarif bergantung pada unit penagihan, spesifikasi, dan penggunaan. Bandingkan kondisi yang sama dalam harga detail model; satu tarif tidak menentukan total biaya.
Endpoint mana yang harus digunakan Grok STT?
Pakai https://api.tokenlab.sh/v1/audio/transcriptions sebagai default untuk Grok STT. Jika format native penyedia didukung, API workbench juga menampilkan endpoint tersebut.
Operasi apa saja yang didukung Grok STT?
Grok STT mendukung Suara ke teks. Pilih operasi di API workbench di atas untuk melihat endpoint dan contoh kode terkait.
Bandingkan Grok STT
Sumber
Ditinjau 2 Okt 2026