xAI: Grok STT
grok-stt- Preis
- Ab $0.000028
- Modalitäten
- Audio
Über Grok STT
Grok STT ist der Speech-to-Text-Dienst von xAI, um aufgezeichnetes Audio in Text umzuwandeln. Dieses Modell verarbeitet hochgeladene Aufnahmen im Batch-Verfahren und gibt das Transkript als JSON zurück. xAI dokumentiert die Unterstützung von 25 Sprachen für seinen Transkriptionsdienst. Da Echtzeit-Streaming-Transkription über eine separate xAI-Schnittstelle erfolgt, eignet sich dieses Modell für bereits existierende Dateien wie Meetings, Anrufe und Interviews.
Stärken
- Transkribiert hochgeladene Audiodateien in einer Anfrage und gibt ein JSON-Ergebnis zurück.
- xAI dokumentiert die Unterstützung von 25 Sprachen, was viele mehrsprachige Aufnahmen abdeckt.
- Geeignet für Batch-Aufträge wie Meeting-Archive, Anrufaufzeichnungen und Interview-Backlogs.
- Funktioniert über das Standardformat für Audiotranskriptionsanfragen, sodass bestehende Whisper-kompatible Clients nur wenige Änderungen benötigen.
- Lange Aufnahmen werden als einzelne Datei hochgeladen, anstatt sie in kurze Stücke zu unterteilen.
Alternativen
- Nur Batch; Live-Untertitelung und Streaming mit geringer Latenz erfordern eine separate Echtzeit-Schnittstelle.
- Die Ausgabe ist ein Transkript in JSON, ohne integrierte Zusammenfassungs- oder Übersetzungsfunktion.
- Die Genauigkeit hängt von der Audioqualität ab; bei verrauschter oder überlappender Sprache kann eine Bereinigung oder Überprüfung erforderlich sein.
Erste Schritte
API-Schlüssel erstellen
Erstelle einen Schlüssel in Console und nutze ihn mit jedem Modell auf der Plattform.
Senden Sie Ihre erste Anfrage
Kopieren Sie das Beispiel für Ihre Sprache und führen Sie es gegen den Endpunkt aus.
Sprache zu TextTokenLab-EndpunktPOST/v1/audio/transcriptionscurl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \ -H "Authorization: Bearer sk-xxx" \ -F file="@audio.mp3" \ -F operation="stt" \ -F response_format="json" \ -F model="grok-stt" \ -F language="en"
Preise
Der offizielle Preis ist die öffentliche Basisvorgabe des Modellerstellers. Der TokenLab-Preis ist das, was du für dieses Modell auf TokenLab zahlst.
Sprache zu Text
pro Sekunde- Offizieller Preis
- $0.00002778
- Official
- $0.00002778
- Rabatt
- —
| Offizieller Preispro Sekunde | Officialpro Sekunde | Rabatt | |
|---|---|---|---|
| Sprache zu Text | $0.00002778 | $0.00002778 | — |
Nutzung & Aktivität
Die Erfolgsquote ist der Anteil abgeschlossener Anfragen. Die Latenz ist die Dauer einer vollständigen Antwort; P95 bedeutet, dass 95 % der Anfragen innerhalb dieser Zeit abgeschlossen wurden.
Nutzung & Verfügbarkeit
Letzte 24 Stunden- Anfragen
- Erfolgsrate
- P95-Latenz
- Token gesamt
Die Daten basieren auf aggregierten Benutzeranfragen, Statusprüfungen sind ausgeschlossen.
In Console öffnen
Öffne Grok STT in Console mit einer bearbeitbaren oder versandbereiten Eingabeaufforderung.
Teste grok-stt mit einer kurzen Audio-Anfrage an /v1/audio/transcriptions. Zeige Ergebnis und Kosten.
Anwendungsfälle
Meeting-Transkripte
Laden Sie aufgezeichnete Anrufe oder Meetings hoch und speichern Sie den Text, damit Teams ihn durchsuchen oder an ein zusammenfassendes Modell weiterleiten können.
Interview- und Podcast-Archive
Wandeln Sie einen Bestand an Aufnahmen in Text um, um ihn zu bearbeiten, Zitate zu erstellen und Shownotes zu verfassen.
Überprüfung von Support-Anrufen
Transkribieren Sie Kundenanrufe in großen Mengen, damit Qualitätsteams diese auf Probleme und Themen hin scannen können.
Prompt-Beispiele
Transkribiere diese 45-minütige Meeting-Aufzeichnung auf Englisch.
Transkribiere den angehängten Kundenanruf. Die Sprecher sprechen Spanisch.
Wandle diesen aufgezeichneten Vortrag in Text um, damit ich ihn nach dem Abschnitt über Photosynthese durchsuchen kann.
FAQ
Was ist Grok STT?
Es ist der Speech-to-Text-Dienst von xAI. Er akzeptiert eine hochgeladene Aufnahme und gibt das Transkript als JSON zurück; er arbeitet im Batch-Modus, nicht live. Verwenden Sie ihn für Aufnahmen, die Sie bereits haben, wie Meetings, Anrufe und Interviews.
Welche Sprachen werden unterstützt?
xAI dokumentiert 25 Sprachen für seinen Transkriptionsdienst. Testen Sie zuerst eine kurze Probe in Ihrer Sprache, da die Genauigkeit je nach Sprache und Aufnahmequalität variiert. Auch Akzente beeinflussen die Ergebnisse.
Kann Grok STT Live-Audio transkribieren?
Nein. Er verarbeitet nur hochgeladene Dateien; verwenden Sie ihn daher erst, nachdem ein Anruf oder Meeting beendet wurde. xAI bietet Streaming-Transkription über eine separate Schnittstelle an, und für Live-Untertitelung ist diese Schnittstelle anstelle dieses Modells erforderlich.
Welches Format erhalte ich zurück?
Eine JSON-Antwort, die den Transkripttext enthält. Sie können diesen Text an ein Sprachmodell weiterleiten, um Zusammenfassungen, Aufgabenlisten oder Übersetzungen in eine andere Sprache zu erhalten.
Wie unterscheidet es sich von Whisper?
Beide transkribieren hochgeladenes Audio über denselben Anfragestil. Sie unterscheiden sich in der Sprachabdeckung und der Genauigkeit je nach Audiotyp. Führen Sie daher beide auf einer Auswahl Ihrer Aufnahmen aus und vergleichen Sie die Transkripte.
Was kostet Grok STT?
Auf TokenLab kostet Grok STT $0.00002778 pro Sekunde. Die vollständige Aufschlüsselung steht in der Preistabelle oben. Die Preise hängen von Abrechnungseinheit, Spezifikation und Nutzung ab. Vergleichen Sie gleiche Bedingungen in der detaillierten Preisliste des Modells; eine einzelne Rate bestimmt nicht die Gesamtkosten.
Welchen Endpunkt soll Grok STT verwenden?
Verwenden Sie https://api.tokenlab.sh/v1/audio/transcriptions für Grok STT. Das folgende Anforderungsbeispiel zeigt die passende Code-Struktur.
Welche Operationen unterstützt Grok STT?
Grok STT unterstützt Sprache zu Text. Wählen Sie oben einen Vorgang aus, um dessen Endpunkt und Anforderungsbeispiel anzuzeigen.
Grok STT vergleichen
Quellen
Geprüft am 02.10.2026