xAI: Grok Voice STT
grok-voice-stt- Preis
- Ab $0.000028
- Modalitäten
- Audio
Über Grok Voice STT
Grok Voice STT ist das Speech-to-Text-Modell von xAI, das aufgezeichnetes oder gestreamtes Audio in Texttranskripte umwandelt. Es akzeptiert gängige Audiodateiformate, gibt Zeitstempel auf Wortebene zurück, kann Sprecher und Kanäle trennen und formatiert Zahlen und Währungen je nach Sprache. Verwenden Sie es für Untertitel, durchsuchbare Besprechungsprotokolle und Anrufprotokolle, die in spätere Textanalysen einfließen.
Stärken
- Zeitstempel auf Wortebene machen es einfach, Untertitel, Suchfunktionen für bestimmte Zeitpunkte und Untertiteldateien aus dem Transkript zu erstellen.
- Sprecherdiarisierung und Mehrkanal-Transkription trennen, wer was in Besprechungen und zweiseitigen Anrufaufzeichnungen gesagt hat.
- Sprachhinweise und eine Liste benutzerdefinierter Schlüsselbegriffe lenken die Erkennung auf Produktnamen und Fachjargon.
- Die Textformatierung gibt Zahlen, Daten und Währungen so wieder, wie sie in der gesprochenen Sprache geschrieben werden.
Alternativen
- Es erstellt nur Transkripte; für das Zusammenfassen, Übersetzen oder Beantworten von Fragen aus dem Audio wird danach ein Textmodell benötigt.
- Bei sehr verrauschten Aufnahmen muss möglicherweise der Schwellenwert für die Spracherkennung angepasst oder das Eingangssignal bereinigt werden, bevor die Genauigkeit akzeptabel ist.
Erste Schritte
API-Schlüssel erstellen
Erstelle einen Schlüssel in Console und nutze ihn mit jedem Modell auf der Plattform.
Senden Sie Ihre erste Anfrage
Kopieren Sie das Beispiel für Ihre Sprache und führen Sie es gegen den Endpunkt aus.
Sprache zu TextTokenLab-EndpunktPOST/v1/audio/transcriptionscurl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \ -H "Authorization: Bearer sk-xxx" \ -F file="@audio.mp3" \ -F operation="stt" \ -F response_format="json" \ -F model="grok-voice-stt" \ -F language="en"
Preise
Der offizielle Preis ist die öffentliche Basisvorgabe des Modellerstellers. Der TokenLab-Preis ist das, was du für dieses Modell auf TokenLab zahlst.
Preise
pro Sekunde- Official
- $0.000028pro Sekunde
- Offizieller Preis
- $0.000028pro Sekunde
| Offizieller Preispro Sekunde | Officialpro Sekunde | Rabatt | |
|---|---|---|---|
| Preis | $0.000028pro Sekunde | $0.000028pro Sekunde | — |
Nutzung & Aktivität
Die Erfolgsquote ist der Anteil abgeschlossener Anfragen. Die Latenz ist die Dauer einer vollständigen Antwort; P95 bedeutet, dass 95 % der Anfragen innerhalb dieser Zeit abgeschlossen wurden.
Nutzung & Verfügbarkeit
Letzte 24 Stunden- Anfragen
- Erfolgsrate
- P95-Latenz
- Token gesamt
Die Daten basieren auf aggregierten Benutzeranfragen, Statusprüfungen sind ausgeschlossen.
In Console öffnen
Öffne Grok Voice STT in Console mit einer bearbeitbaren oder versandbereiten Eingabeaufforderung.
Teste grok-voice-stt mit einer kurzen Audio-Anfrage an /v1/audio/transcriptions. Zeige Ergebnis und Kosten.
Anwendungsfälle
Besprechungsprotokolle
Transkribieren Sie einen aufgezeichneten Anruf mit gekennzeichneten Sprechern und leiten Sie den Text dann zur Erstellung von Aktionspunkten an einen Zusammenfassungsdienst weiter.
Untertitel für Videos
Generieren Sie zeitgesteuerte Untertitel aus der Audiospur eines hochgeladenen Videos unter Verwendung der Wort-Timings.
Qualitätsprüfung im Call-Center
Transkribieren Sie Zweikanal-Aufnahmen mit Agent und Kunde auf getrennten Kanälen und scannen Sie diese dann nach Compliance-Phrasen.
Prompt-Beispiele
Transkribieren Sie diese 45-minütige Podcast-Episode auf Englisch mit Wort-Zeitstempeln und gekennzeichneten Sprechern.
Transkribieren Sie den angehängten Kundenanruf und verwenden Sie die Schlüsselbegriffe 'Zyntra', 'OmniPlan' und 'SLA', um die Erkennung zu beeinflussen.
Konvertieren Sie dieses spanische Sprachmemo in Text und formatieren Sie die Beträge als Währung.
FAQ
Was macht Grok Voice STT?
Es wandelt Audio in Text um. Sie senden eine Datei oder streamen Audio, und es gibt ein Transkript zurück, das je nach gewählten Optionen Zeitstempel auf Wortebene, Sprecherkennzeichnungen und Text pro Kanal enthalten kann.
Welche Audioformate kann es lesen?
xAI listet zwölf Formate auf, darunter MP3, WAV, FLAC und Opus, mit einer Dateigrößenbeschränkung von 500 MB. Rohes PCM-, mu-law- und A-law-Audio erfordert explizite Kodierungsparameter.
Unterstützt es Live-Transkription?
Ja. Ein WebSocket-Endpunkt streamt Zwischenergebnisse und verwendet die Smart-Turn-End-of-Turn-Erkennung, um natürliche Pausen vom Ende eines Satzes zu unterscheiden, was vorzeitige Abbrüche reduziert.
Wie viele Sprachen deckt es ab?
xAI dokumentiert mehr als 25 Sprachen für die Transkription und sprachspezifische Formatierung. Geben Sie einen Sprachhinweis an, wenn Sie die Sprache kennen, damit die Erkennung nicht raten muss.
Kann es Sprecher unterscheiden?
Ja, die Diarisierung kennzeichnet Sprecher innerhalb einer Aufnahme, und der Mehrkanalmodus verarbeitet bis zu acht separate Kanäle, was für Anrufaufzeichnungen mit einer Partei pro Kanal geeignet ist.
Was kostet Grok Voice STT?
Auf TokenLab kostet Grok Voice STT $0.000028 pro Sekunde. Die vollständige Aufschlüsselung steht in der Preistabelle oben.
Welchen Endpunkt soll Grok Voice STT verwenden?
Verwenden Sie https://api.tokenlab.sh/v1/audio/transcriptions für Grok Voice STT. Das folgende Anforderungsbeispiel zeigt die passende Code-Struktur.
Welche Operationen unterstützt Grok Voice STT?
Grok Voice STT unterstützt Sprache zu Text. Wählen Sie oben einen Vorgang aus, um dessen Endpunkt und Anforderungsbeispiel anzuzeigen.
Grok Voice STT vergleichen
Quellen
Geprüft am 02.10.2026