Pilih Auto, TokenLab Verified, atau Official untuk setiap permintaan, dengan harga yang ditampilkan di awal.Lihat yang baru

xAI: Grok Voice STT

Grok Voice STT mengubah audio rekaman menjadi teks. Petunjuk bahasa dan kontrol stempel waktu membuatnya berguna untuk transkrip yang akan memberi makan takarir, pencarian, atau langkah analisis teks selanjutnya.
Bandingkan model
grok-voice-stt
TersediaxAIUcapan ke TeksSinkronkan
Harga
Mulai dari $0.000028
Modalitas
Audio

Tentang Grok Voice STT

Grok Voice STT adalah model speech-to-text xAI, yang mengubah audio rekaman atau streaming menjadi transkrip teks. Model ini menerima format file audio umum, mengembalikan stempel waktu tingkat kata, dapat memisahkan pembicara dan saluran, serta memformat angka dan mata uang berdasarkan bahasa. Gunakan untuk teks (caption), catatan rapat yang dapat dicari, dan transkrip panggilan yang menjadi input untuk analisis teks selanjutnya.

Kelebihan

  • Stempel waktu tingkat kata memudahkan pembuatan teks (caption), pencarian lompat-ke-momen, dan file subtitle dari transkrip.
  • Diarisasi pembicara dan transkripsi multisaluran memisahkan siapa yang berbicara dalam rapat dan rekaman panggilan dua arah.
  • Petunjuk bahasa dan daftar istilah kunci kustom mengarahkan pengenalan ke nama produk dan jargon.
  • Pemformatan teks merender angka, tanggal, dan mata uang sesuai cara penulisan bahasa lisan tersebut.

Kapan harus beralih

  • Ini hanya menghasilkan transkrip; meringkas, menerjemahkan, atau menjawab dari audio memerlukan model teks setelahnya.
  • Rekaman yang sangat bising mungkin memerlukan penyesuaian ambang batas deteksi suara atau input yang lebih bersih agar akurasinya dapat diterima.

Memulai

  1. Buat API key

    Buat kunci di Console, gunakan untuk semua model di platform.

  2. Kirim permintaan pertama Anda

    Salin contoh untuk bahasa Anda dan jalankan terhadap endpoint tersebut.

    Suara ke teksEndpoint TokenLab
    POST/v1/audio/transcriptions
    curl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \
      -H "Authorization: Bearer sk-xxx" \
      -F file="@audio.mp3" \
      -F operation="stt" \
      -F response_format="json" \
      -F model="grok-voice-stt" \
      -F language="en"

Penetapan Harga

Harga Official adalah baseline publik pembuat model. Harga TokenLab adalah yang Anda bayar untuk model ini di TokenLab.

Penetapan Harga

per detik
Official
$0.000028per detik
Harga Official
$0.000028per detik

Penggunaan & aktivitas

Tingkat keberhasilan adalah proporsi permintaan yang selesai. Latensi adalah berapa lama respons penuh berlangsung; P95 berarti 95% permintaan selesai dalam waktu tersebut.

Penggunaan & ketersediaan

24 jam terakhir
Permintaan
Tingkat keberhasilan
Latensi P95
Total token
Performa model
Metrik akan muncul setelah ambang batas privasi dan volume data terpenuhi.

Data didasarkan pada permintaan pengguna gabungan, tidak termasuk pemeriksaan status.

Buka di Console

Buka Grok Voice STT di Console dengan prompt siap diedit atau dikirim.

Bantu saya mencoba grok-voice-stt dengan permintaan audio singkat di /v1/audio/transcriptions. Tampilkan hasil dan biayanya.

Skenario penggunaan

  • Transkrip rapat

    Mentranskripsikan panggilan yang direkam dengan pelabelan pembicara, lalu teruskan teks ke peringkas untuk poin-poin tindakan.

  • Subtitle untuk video

    Hasilkan teks (caption) berwaktu dari trek audio video yang diunggah menggunakan pengaturan waktu kata.

  • Tinjauan kualitas pusat panggilan

    Mentranskripsikan rekaman dua saluran dengan agen dan pelanggan pada saluran terpisah, lalu pindai untuk mencari frasa kepatuhan.

Contoh prompt

Mentranskripsikan episode podcast 45 menit ini dalam bahasa Inggris dengan stempel waktu kata dan pelabelan pembicara.

Mentranskripsikan panggilan pelanggan yang dilampirkan, menggunakan istilah kunci 'Zyntra', 'OmniPlan', dan 'SLA' untuk memengaruhi pengenalan.

Konversikan memo suara bahasa Spanyol ini menjadi teks dan format jumlahnya sebagai mata uang.

FAQ

Apa yang dilakukan Grok Voice STT?

Ini mengubah audio menjadi teks. Anda mengirim file atau streaming audio, dan model ini mengembalikan transkrip yang dapat menyertakan stempel waktu tingkat kata, label pembicara, dan teks per saluran, tergantung pada opsi yang Anda tetapkan.

Format audio apa yang dapat dibacanya?

xAI mencantumkan dua belas format, termasuk MP3, WAV, FLAC, dan Opus, dengan batas ukuran file 500 MB. Audio PCM mentah, mu-law, dan A-law memerlukan parameter pengodean eksplisit.

Apakah mendukung transkripsi langsung?

Ya. Endpoint WebSocket melakukan streaming hasil sementara dan menggunakan deteksi akhir giliran bicara Smart Turn untuk membedakan jeda alami dari akhir kalimat, yang mengurangi pemotongan prematur.

Berapa banyak bahasa yang dicakupnya?

xAI mendokumentasikan lebih dari 25 bahasa untuk transkripsi dan pemformatan khusus bahasa. Berikan petunjuk bahasa saat Anda mengetahui bahasanya, sehingga pengenalan tidak perlu menebak.

Bisakah model ini membedakan pembicara?

Ya, diarisasi melabeli pembicara dalam rekaman, dan mode multisaluran menangani hingga delapan saluran terpisah, yang cocok untuk rekaman panggilan dengan satu pihak per saluran.

Berapa biaya Grok Voice STT?

Di TokenLab, Grok Voice STT dikenakan $0.000028 per detik. Tabel harga di atas menampilkan rincian lengkap.

Endpoint mana yang harus digunakan Grok Voice STT?

Pakai https://api.tokenlab.sh/v1/audio/transcriptions sebagai default untuk Grok Voice STT. Jika format native penyedia didukung, API workbench juga menampilkan endpoint tersebut.

Operasi apa saja yang didukung Grok Voice STT?

Grok Voice STT mendukung Suara ke teks. Pilih operasi di API workbench di atas untuk melihat endpoint dan contoh kode terkait.

Bandingkan Grok Voice STT

Sumber

Ditinjau 2 Okt 2026

Lainnya dari Grok Voice

Model terkait