Pilih Auto, TokenLab Verified, atau Official untuk setiap permintaan, dengan harga yang ditampilkan di awal.Lihat yang baru

xAI: Grok STT

Grok STT adalah layanan ucapan-ke-teks xAI untuk rekaman yang diunggah. Integrasi ini menyediakan transkripsi batch dengan durasi audio yang dilaporkan; layanan streaming waktu nyata menggunakan antarmuka dan kontrak harga yang terpisah.
Bandingkan model
grok-stt
TersediaxAIUcapan ke TeksSinkronkan
Harga
Mulai dari $0.000028
Modalitas
Audio

Tentang Grok STT

Grok STT adalah layanan speech-to-text dari xAI untuk mengubah rekaman audio menjadi teks. Model ini menangani rekaman yang diunggah dalam bentuk batch dan mengembalikan transkrip dalam format JSON. xAI mendokumentasikan dukungan untuk 25 bahasa dalam layanan transkripsinya. Transkripsi streaming real-time merupakan antarmuka xAI yang terpisah, sehingga model ini cocok untuk file yang sudah ada seperti rapat, panggilan, dan wawancara.

Kelebihan

  • Mentranskripsikan file audio yang diunggah dalam satu permintaan dan mengembalikan hasil JSON.
  • xAI mendokumentasikan dukungan untuk 25 bahasa, mencakup banyak rekaman multibahasa.
  • Cocok untuk pekerjaan batch seperti arsip rapat, rekaman panggilan, dan tumpukan wawancara.
  • Bekerja melalui format permintaan transkripsi audio standar, sehingga klien bergaya Whisper yang sudah ada hanya memerlukan sedikit perubahan.
  • Rekaman panjang ditangani sebagai satu unggahan file, bukan dipecah menjadi potongan-potongan pendek.

Kapan harus beralih

  • Hanya batch; teks langsung (live captioning) dan streaming latensi rendah memerlukan antarmuka real-time yang terpisah.
  • Output berupa transkrip dalam JSON, tanpa fitur peringkasan atau penerjemahan bawaan.
  • Akurasi bergantung pada kualitas audio, sehingga ucapan yang bising atau tumpang tindih mungkin memerlukan pembersihan atau peninjauan.

Memulai

  1. Buat API key

    Buat kunci di Console, gunakan untuk semua model di platform.

  2. Kirim permintaan pertama Anda

    Salin contoh untuk bahasa Anda dan jalankan terhadap endpoint tersebut.

    Suara ke teksEndpoint TokenLab
    POST/v1/audio/transcriptions
    curl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \
      -H "Authorization: Bearer sk-xxx" \
      -F file="@audio.mp3" \
      -F operation="stt" \
      -F response_format="json" \
      -F model="grok-stt" \
      -F language="en"

Penetapan Harga

Harga Official adalah baseline publik pembuat model. Harga TokenLab adalah yang Anda bayar untuk model ini di TokenLab.

Suara ke teks

per detik
Harga Official
$0.00002778
Official
$0.00002778
Diskon
—

Penggunaan & aktivitas

Tingkat keberhasilan adalah proporsi permintaan yang selesai. Latensi adalah berapa lama respons penuh berlangsung; P95 berarti 95% permintaan selesai dalam waktu tersebut.

Penggunaan & ketersediaan

24 jam terakhir
Permintaan
Tingkat keberhasilan
Latensi P95
Total token
Performa model
Metrik akan muncul setelah ambang batas privasi dan volume data terpenuhi.

Data didasarkan pada permintaan pengguna gabungan, tidak termasuk pemeriksaan status.

Buka di Console

Buka Grok STT di Console dengan prompt siap diedit atau dikirim.

Bantu saya mencoba grok-stt dengan permintaan audio singkat di /v1/audio/transcriptions. Tampilkan hasil dan biayanya.

Skenario penggunaan

  • Transkrip rapat

    Unggah panggilan atau rapat yang direkam dan simpan teksnya agar tim dapat mencarinya atau memasukkannya ke model peringkasan.

  • Arsip wawancara dan podcast

    Ubah tumpukan rekaman menjadi teks untuk penyuntingan, kutipan, dan catatan acara.

  • Tinjauan panggilan dukungan

    Transkripsikan panggilan pelanggan secara massal agar tim kualitas dapat memindai masalah dan topik.

Contoh prompt

Transkripsikan rekaman rapat tim berdurasi 45 menit ini dalam bahasa Inggris.

Transkripsikan panggilan pelanggan yang dilampirkan. Para pembicara berbicara dalam bahasa Spanyol.

Ubah kuliah yang direkam ini menjadi teks agar saya dapat mencarinya untuk bagian tentang fotosintesis.

FAQ

Apa itu Grok STT?

Ini adalah layanan speech-to-text dari xAI. Layanan ini menerima rekaman yang diunggah dan mengembalikan transkrip sebagai JSON, bekerja dalam mode batch, bukan langsung. Gunakan untuk rekaman yang sudah Anda miliki, seperti rapat, panggilan, dan wawancara.

Bahasa apa saja yang didukungnya?

xAI mendokumentasikan 25 bahasa untuk layanan transkripsinya. Uji sampel singkat dalam bahasa Anda terlebih dahulu, karena akurasi bervariasi tergantung pada bahasa dan kualitas rekaman. Aksen juga memengaruhi hasil.

Bisakah Grok STT mentranskripsikan audio langsung?

Tidak. Model ini hanya menangani file yang diunggah, jadi gunakan setelah panggilan atau rapat berakhir. xAI menawarkan transkripsi streaming melalui antarmuka terpisah, dan teks langsung memerlukan antarmuka tersebut, bukan model ini.

Format apa yang saya dapatkan?

Respons JSON yang berisi teks transkrip. Anda dapat meneruskan teks tersebut ke model bahasa untuk ringkasan, poin tindakan, atau terjemahan ke bahasa lain.

Apa bedanya dengan Whisper?

Keduanya mentranskripsikan audio yang diunggah melalui gaya permintaan yang sama. Keduanya berbeda dalam cakupan bahasa dan akurasi berdasarkan jenis audio, jadi jalankan keduanya pada sampel rekaman Anda dan bandingkan transkripnya.

Berapa biaya Grok STT?

Di TokenLab, Grok STT dikenakan $0.00002778 per detik. Tabel harga di atas menampilkan rincian lengkap. Tarif bergantung pada unit penagihan, spesifikasi, dan penggunaan. Bandingkan kondisi yang sama dalam harga detail model; satu tarif tidak menentukan total biaya.

Endpoint mana yang harus digunakan Grok STT?

Pakai https://api.tokenlab.sh/v1/audio/transcriptions sebagai default untuk Grok STT. Jika format native penyedia didukung, API workbench juga menampilkan endpoint tersebut.

Operasi apa saja yang didukung Grok STT?

Grok STT mendukung Suara ke teks. Pilih operasi di API workbench di atas untuk melihat endpoint dan contoh kode terkait.

Bandingkan Grok STT

Sumber

Ditinjau 2 Okt 2026

Lainnya dari Grok Voice

Model terkait