Fiyatları önceden gösterilen Auto, TokenLab Verified veya Official seçeneklerinden her istek için birini seçin.Yenilikleri gör

xAI: Grok Voice STT

Grok Voice STT, kaydedilmiş sesi metne dönüştürür. Dil ipuçları ve zaman damgası kontrolleri, onu altyazı, arama veya sonraki bir metin analizi adımını besleyecek dökümler için kullanışlı kılar.
Modelleri karşılaştır
grok-voice-stt
MevcutxAIKonuşmadan MetneSenkron
Fiyat
İtibaren $0.000028
Modlar
Ses

Grok Voice STT hakkında

Grok Voice STT, xAI'nin kaydedilmiş veya akış halindeki sesi metin transkriptlerine dönüştüren konuşmadan metne modelidir. Yaygın ses dosyası formatlarını kabul eder, kelime düzeyinde zaman damgaları döndürür, konuşmacıları ve kanalları ayırabilir, sayıları ve para birimlerini dile göre biçimlendirebilir. Bunu altyazılar, aranabilir toplantı kayıtları ve daha sonraki metin analizlerini besleyen çağrı transkriptleri için kullanın.

Güçlü yönleri

  • Kelime düzeyindeki zaman damgaları; altyazı, anlık arama ve transkriptten altyazı dosyaları oluşturmayı doğrudan mümkün kılar.
  • Konuşmacı diyarı (diarization) ve çok kanallı transkripsiyon, toplantılarda ve iki taraflı çağrı kayıtlarında kimin ne söylediğini birbirinden ayırır.
  • Dil ipuçları ve özel anahtar terimler listesi, tanıma sürecini ürün adlarına ve teknik terimlere yönlendirir.
  • Metin biçimlendirme; sayıları, tarihleri ve para birimlerini konuşma dilinin yazım biçimine göre düzenler.

Alternatif aramanız gereken durumlar

  • Yalnızca transkript üretir; sesten özetleme, çeviri veya yanıtlama yapmak için sonrasında bir metin modeli gerekir.
  • Çok gürültülü kayıtlar, ses algılama eşiğinin ayarlanmasını veya doğruluk kabul edilebilir düzeye gelmeden önce daha temiz bir giriş gerektirebilir.

Başlarken

  1. API anahtarı oluştur

    Console'da bir anahtar oluşturun, platformdaki tüm modellerle kullanın.

  2. İlk isteğinizi gönderin

    Diliniz için olan örneği kopyalayın ve uç noktada çalıştırın.

    Konuşmadan metneTokenLab uç noktası
    POST/v1/audio/transcriptions
    curl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \
      -H "Authorization: Bearer sk-xxx" \
      -F file="@audio.mp3" \
      -F operation="stt" \
      -F response_format="json" \
      -F model="grok-voice-stt" \
      -F language="en"

Fiyatlandırma

Official fiyat, model yapımcısının açık temel fiyatıdır. TokenLab fiyatı, bu modeli TokenLab'de ödediğiniz tutardır.

Fiyatlandırma

saniye başına
Official
$0.000028saniye başına
Resmi fiyat
$0.000028saniye başına

Kullanım ve etkinlik

Başarı oranı, tamamlanan isteklerin payıdır. Gecikme, tam bir yanıtın ne kadar sürdüğüdür; P95, isteklerin %95’inin bu süre içinde tamamlandığı anlamına gelir.

Kullanım ve kullanılabilirlik

Son 24 saat
İstekler
Başarı oranı
P95 gecikmesi
Toplam token
Model performansı
Metrikler, gizlilik ve veri hacmi eşikleri karşılandığında görünür.

Veriler, durum kontrolleri hariç tutularak toplu kullanıcı isteklerine dayanmaktadır.

Console'da aç

Grok Voice STT modelini Console'da açın, istemi düzenlemek veya göndermek için hazır hale getirin.

grok-voice-stt ile /v1/audio/transcriptions üzerinden kısa bir ses isteği dene. Sonucu ve maliyeti göster.

Kullanım senaryoları

  • Toplantı transkriptleri

    Kaydedilmiş bir çağrıyı konuşmacıları etiketleyerek yazıya dökün, ardından metni eylem maddeleri için bir özetleyiciye gönderin.

  • Video için altyazılar

    Kelime zamanlamalarını kullanarak yüklenen bir videonun ses kanalından zaman ayarlı altyazılar oluşturun.

  • Çağrı merkezi kalite incelemesi

    Aracı ve müşterinin ayrı kanallarda olduğu iki kanallı kayıtları yazıya dökün, ardından uyumluluk ifadeleri için tarayın.

Prompt örnekleri

Bu 45 dakikalık İngilizce podcast bölümünü kelime zaman damgaları ve konuşmacı etiketleriyle yazıya dökün.

Ekli müşteri çağrısını, 'Zyntra', 'OmniPlan' ve 'SLA' anahtar terimlerini kullanarak tanımayı yönlendirecek şekilde yazıya dökün.

Bu İspanyolca sesli notu metne dönüştürün ve tutarları para birimi olarak biçimlendirin.

FAQ

Grok Voice STT ne yapar?

Sesi metne dönüştürür. Bir dosya gönderir veya ses akışı sağlarsınız; sistem, ayarladığınız seçeneklere bağlı olarak kelime düzeyinde zaman damgaları, konuşmacı etiketleri ve kanal bazlı metin içerebilen bir transkript döndürür.

Hangi ses formatlarını okuyabilir?

xAI, MP3, WAV, FLAC ve Opus dahil olmak üzere 500 MB dosya boyutu sınırına sahip on iki format listeler. Ham PCM, mu-law ve A-law sesleri açık kodlama parametreleri gerektirir.

Canlı transkripsiyonu destekliyor mu?

Evet. Bir WebSocket uç noktası ara sonuçları yayınlar ve doğal duraksamaları cümle sonundan ayırt etmek için Smart Turn (akıllı sıra alma) sonlandırma algılamasını kullanır; bu da erken kesilmeleri azaltır.

Kaç dili kapsıyor?

xAI, transkripsiyon ve dile özgü biçimlendirme için 25'ten fazla dili belgelemektedir. Dili bildiğinizde bir dil ipucu iletin, böylece tanıma sistemi tahmin yapmak zorunda kalmaz.

Konuşmacıları birbirinden ayırabilir mi?

Evet, diyarı (diarization) özelliği bir kayıt içindeki konuşmacıları etiketler ve çok kanallı mod, her tarafa bir kanal düşecek şekilde sekiz ayrı kanala kadar destek sağlar; bu da çağrı kayıtları için uygundur.

Grok Voice STT ne kadara mal olur?

TokenLab üzerinde Grok Voice STT $0.000028 saniye başına'dır. Tam dökümü yukarıdaki fiyat tablosunda bulabilirsiniz.

Grok Voice STT hangi endpoint'i kullanmalı?

Grok Voice STT için varsayılan olarak https://api.tokenlab.sh/v1/audio/transcriptions kullanın. Sağlayıcıya özgü yerel format destekleniyorsa API workbench bu endpoint'i de gösterir.

Grok Voice STT hangi operasyonları destekler?

Grok Voice STT Konuşmadan metne destekler. Yukarıdaki API workbench'te bir operasyon seçerek ilgili endpoint ve kod örneğini görebilirsiniz.

Grok Voice STT karşılaştırması

Kaynaklar

2 Eki 2026 tarihinde incelendi

Grok Voice serisinden daha fazlası

İlgili modeller