xAI: Grok Voice STT
grok-voice-stt- Fiyat
- İtibaren $0.000028
- Modlar
- Ses
Grok Voice STT hakkında
Grok Voice STT, xAI'nin kaydedilmiş veya akış halindeki sesi metin transkriptlerine dönüştüren konuşmadan metne modelidir. Yaygın ses dosyası formatlarını kabul eder, kelime düzeyinde zaman damgaları döndürür, konuşmacıları ve kanalları ayırabilir, sayıları ve para birimlerini dile göre biçimlendirebilir. Bunu altyazılar, aranabilir toplantı kayıtları ve daha sonraki metin analizlerini besleyen çağrı transkriptleri için kullanın.
Güçlü yönleri
- Kelime düzeyindeki zaman damgaları; altyazı, anlık arama ve transkriptten altyazı dosyaları oluşturmayı doğrudan mümkün kılar.
- Konuşmacı diyarı (diarization) ve çok kanallı transkripsiyon, toplantılarda ve iki taraflı çağrı kayıtlarında kimin ne söylediğini birbirinden ayırır.
- Dil ipuçları ve özel anahtar terimler listesi, tanıma sürecini ürün adlarına ve teknik terimlere yönlendirir.
- Metin biçimlendirme; sayıları, tarihleri ve para birimlerini konuşma dilinin yazım biçimine göre düzenler.
Alternatif aramanız gereken durumlar
- Yalnızca transkript üretir; sesten özetleme, çeviri veya yanıtlama yapmak için sonrasında bir metin modeli gerekir.
- Çok gürültülü kayıtlar, ses algılama eşiğinin ayarlanmasını veya doğruluk kabul edilebilir düzeye gelmeden önce daha temiz bir giriş gerektirebilir.
Başlarken
API anahtarı oluştur
Console'da bir anahtar oluşturun, platformdaki tüm modellerle kullanın.
İlk isteğinizi gönderin
Diliniz için olan örneği kopyalayın ve uç noktada çalıştırın.
Konuşmadan metneTokenLab uç noktasıPOST/v1/audio/transcriptionscurl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \ -H "Authorization: Bearer sk-xxx" \ -F file="@audio.mp3" \ -F operation="stt" \ -F response_format="json" \ -F model="grok-voice-stt" \ -F language="en"
Fiyatlandırma
Official fiyat, model yapımcısının açık temel fiyatıdır. TokenLab fiyatı, bu modeli TokenLab'de ödediğiniz tutardır.
Fiyatlandırma
saniye başına- Official
- $0.000028saniye başına
- Resmi fiyat
- $0.000028saniye başına
| Resmi fiyatsaniye başına | Officialsaniye başına | İndirim | |
|---|---|---|---|
| Fiyat | $0.000028saniye başına | $0.000028saniye başına | — |
Kullanım ve etkinlik
Başarı oranı, tamamlanan isteklerin payıdır. Gecikme, tam bir yanıtın ne kadar sürdüğüdür; P95, isteklerin %95’inin bu süre içinde tamamlandığı anlamına gelir.
Kullanım ve kullanılabilirlik
Son 24 saat- İstekler
- Başarı oranı
- P95 gecikmesi
- Toplam token
Veriler, durum kontrolleri hariç tutularak toplu kullanıcı isteklerine dayanmaktadır.
Console'da aç
Grok Voice STT modelini Console'da açın, istemi düzenlemek veya göndermek için hazır hale getirin.
grok-voice-stt ile /v1/audio/transcriptions üzerinden kısa bir ses isteği dene. Sonucu ve maliyeti göster.
Kullanım senaryoları
Toplantı transkriptleri
Kaydedilmiş bir çağrıyı konuşmacıları etiketleyerek yazıya dökün, ardından metni eylem maddeleri için bir özetleyiciye gönderin.
Video için altyazılar
Kelime zamanlamalarını kullanarak yüklenen bir videonun ses kanalından zaman ayarlı altyazılar oluşturun.
Çağrı merkezi kalite incelemesi
Aracı ve müşterinin ayrı kanallarda olduğu iki kanallı kayıtları yazıya dökün, ardından uyumluluk ifadeleri için tarayın.
Prompt örnekleri
Bu 45 dakikalık İngilizce podcast bölümünü kelime zaman damgaları ve konuşmacı etiketleriyle yazıya dökün.
Ekli müşteri çağrısını, 'Zyntra', 'OmniPlan' ve 'SLA' anahtar terimlerini kullanarak tanımayı yönlendirecek şekilde yazıya dökün.
Bu İspanyolca sesli notu metne dönüştürün ve tutarları para birimi olarak biçimlendirin.
FAQ
Grok Voice STT ne yapar?
Sesi metne dönüştürür. Bir dosya gönderir veya ses akışı sağlarsınız; sistem, ayarladığınız seçeneklere bağlı olarak kelime düzeyinde zaman damgaları, konuşmacı etiketleri ve kanal bazlı metin içerebilen bir transkript döndürür.
Hangi ses formatlarını okuyabilir?
xAI, MP3, WAV, FLAC ve Opus dahil olmak üzere 500 MB dosya boyutu sınırına sahip on iki format listeler. Ham PCM, mu-law ve A-law sesleri açık kodlama parametreleri gerektirir.
Canlı transkripsiyonu destekliyor mu?
Evet. Bir WebSocket uç noktası ara sonuçları yayınlar ve doğal duraksamaları cümle sonundan ayırt etmek için Smart Turn (akıllı sıra alma) sonlandırma algılamasını kullanır; bu da erken kesilmeleri azaltır.
Kaç dili kapsıyor?
xAI, transkripsiyon ve dile özgü biçimlendirme için 25'ten fazla dili belgelemektedir. Dili bildiğinizde bir dil ipucu iletin, böylece tanıma sistemi tahmin yapmak zorunda kalmaz.
Konuşmacıları birbirinden ayırabilir mi?
Evet, diyarı (diarization) özelliği bir kayıt içindeki konuşmacıları etiketler ve çok kanallı mod, her tarafa bir kanal düşecek şekilde sekiz ayrı kanala kadar destek sağlar; bu da çağrı kayıtları için uygundur.
Grok Voice STT ne kadara mal olur?
TokenLab üzerinde Grok Voice STT $0.000028 saniye başına'dır. Tam dökümü yukarıdaki fiyat tablosunda bulabilirsiniz.
Grok Voice STT hangi endpoint'i kullanmalı?
Grok Voice STT için varsayılan olarak https://api.tokenlab.sh/v1/audio/transcriptions kullanın. Sağlayıcıya özgü yerel format destekleniyorsa API workbench bu endpoint'i de gösterir.
Grok Voice STT hangi operasyonları destekler?
Grok Voice STT Konuşmadan metne destekler. Yukarıdaki API workbench'te bir operasyon seçerek ilgili endpoint ve kod örneğini görebilirsiniz.
Grok Voice STT karşılaştırması
Kaynaklar
2 Eki 2026 tarihinde incelendi