Wählen Sie Auto, TokenLab Verified oder Official für jede Anfrage, wobei die Preise vorab angezeigt werden.Neuigkeiten ansehen

xAI: Grok STT

Grok STT ist der Speech-to-Text-Dienst von xAI für hochgeladene Aufnahmen. Diese Integration bietet Batch-Transkription mit der gemeldeten Audiodauer; der Echtzeit-Streaming-Dienst nutzt eine separate Schnittstelle und einen eigenen Preisvertrag.
Modelle vergleichen
grok-stt
VerfügbarxAISprache zu TextSynchron
Preis
Ab $0.000028
Modalitäten
Audio

Über Grok STT

Grok STT ist der Speech-to-Text-Dienst von xAI, um aufgezeichnetes Audio in Text umzuwandeln. Dieses Modell verarbeitet hochgeladene Aufnahmen im Batch-Verfahren und gibt das Transkript als JSON zurück. xAI dokumentiert die Unterstützung von 25 Sprachen für seinen Transkriptionsdienst. Da Echtzeit-Streaming-Transkription über eine separate xAI-Schnittstelle erfolgt, eignet sich dieses Modell für bereits existierende Dateien wie Meetings, Anrufe und Interviews.

Stärken

  • Transkribiert hochgeladene Audiodateien in einer Anfrage und gibt ein JSON-Ergebnis zurück.
  • xAI dokumentiert die Unterstützung von 25 Sprachen, was viele mehrsprachige Aufnahmen abdeckt.
  • Geeignet für Batch-Aufträge wie Meeting-Archive, Anrufaufzeichnungen und Interview-Backlogs.
  • Funktioniert über das Standardformat für Audiotranskriptionsanfragen, sodass bestehende Whisper-kompatible Clients nur wenige Änderungen benötigen.
  • Lange Aufnahmen werden als einzelne Datei hochgeladen, anstatt sie in kurze Stücke zu unterteilen.

Alternativen

  • Nur Batch; Live-Untertitelung und Streaming mit geringer Latenz erfordern eine separate Echtzeit-Schnittstelle.
  • Die Ausgabe ist ein Transkript in JSON, ohne integrierte Zusammenfassungs- oder Übersetzungsfunktion.
  • Die Genauigkeit hängt von der Audioqualität ab; bei verrauschter oder überlappender Sprache kann eine Bereinigung oder Überprüfung erforderlich sein.

Erste Schritte

  1. API-Schlüssel erstellen

    Erstelle einen Schlüssel in Console und nutze ihn mit jedem Modell auf der Plattform.

  2. Senden Sie Ihre erste Anfrage

    Kopieren Sie das Beispiel für Ihre Sprache und führen Sie es gegen den Endpunkt aus.

    Sprache zu TextTokenLab-Endpunkt
    POST/v1/audio/transcriptions
    curl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \
      -H "Authorization: Bearer sk-xxx" \
      -F file="@audio.mp3" \
      -F operation="stt" \
      -F response_format="json" \
      -F model="grok-stt" \
      -F language="en"

Preise

Der offizielle Preis ist die öffentliche Basisvorgabe des Modellerstellers. Der TokenLab-Preis ist das, was du für dieses Modell auf TokenLab zahlst.

Sprache zu Text

pro Sekunde
Offizieller Preis
$0.00002778
Official
$0.00002778
Rabatt
—

Nutzung & Aktivität

Die Erfolgsquote ist der Anteil abgeschlossener Anfragen. Die Latenz ist die Dauer einer vollständigen Antwort; P95 bedeutet, dass 95 % der Anfragen innerhalb dieser Zeit abgeschlossen wurden.

Nutzung & Verfügbarkeit

Letzte 24 Stunden
Anfragen
Erfolgsrate
P95-Latenz
Token gesamt
Modellleistung
Metriken erscheinen, sobald die Schwellenwerte für Datenschutz und Datenvolumen erreicht sind.

Die Daten basieren auf aggregierten Benutzeranfragen, Statusprüfungen sind ausgeschlossen.

In Console öffnen

Öffne Grok STT in Console mit einer bearbeitbaren oder versandbereiten Eingabeaufforderung.

Teste grok-stt mit einer kurzen Audio-Anfrage an /v1/audio/transcriptions. Zeige Ergebnis und Kosten.

Anwendungsfälle

  • Meeting-Transkripte

    Laden Sie aufgezeichnete Anrufe oder Meetings hoch und speichern Sie den Text, damit Teams ihn durchsuchen oder an ein zusammenfassendes Modell weiterleiten können.

  • Interview- und Podcast-Archive

    Wandeln Sie einen Bestand an Aufnahmen in Text um, um ihn zu bearbeiten, Zitate zu erstellen und Shownotes zu verfassen.

  • Überprüfung von Support-Anrufen

    Transkribieren Sie Kundenanrufe in großen Mengen, damit Qualitätsteams diese auf Probleme und Themen hin scannen können.

Prompt-Beispiele

Transkribiere diese 45-minütige Meeting-Aufzeichnung auf Englisch.

Transkribiere den angehängten Kundenanruf. Die Sprecher sprechen Spanisch.

Wandle diesen aufgezeichneten Vortrag in Text um, damit ich ihn nach dem Abschnitt über Photosynthese durchsuchen kann.

FAQ

Was ist Grok STT?

Es ist der Speech-to-Text-Dienst von xAI. Er akzeptiert eine hochgeladene Aufnahme und gibt das Transkript als JSON zurück; er arbeitet im Batch-Modus, nicht live. Verwenden Sie ihn für Aufnahmen, die Sie bereits haben, wie Meetings, Anrufe und Interviews.

Welche Sprachen werden unterstützt?

xAI dokumentiert 25 Sprachen für seinen Transkriptionsdienst. Testen Sie zuerst eine kurze Probe in Ihrer Sprache, da die Genauigkeit je nach Sprache und Aufnahmequalität variiert. Auch Akzente beeinflussen die Ergebnisse.

Kann Grok STT Live-Audio transkribieren?

Nein. Er verarbeitet nur hochgeladene Dateien; verwenden Sie ihn daher erst, nachdem ein Anruf oder Meeting beendet wurde. xAI bietet Streaming-Transkription über eine separate Schnittstelle an, und für Live-Untertitelung ist diese Schnittstelle anstelle dieses Modells erforderlich.

Welches Format erhalte ich zurück?

Eine JSON-Antwort, die den Transkripttext enthält. Sie können diesen Text an ein Sprachmodell weiterleiten, um Zusammenfassungen, Aufgabenlisten oder Übersetzungen in eine andere Sprache zu erhalten.

Wie unterscheidet es sich von Whisper?

Beide transkribieren hochgeladenes Audio über denselben Anfragestil. Sie unterscheiden sich in der Sprachabdeckung und der Genauigkeit je nach Audiotyp. Führen Sie daher beide auf einer Auswahl Ihrer Aufnahmen aus und vergleichen Sie die Transkripte.

Was kostet Grok STT?

Auf TokenLab kostet Grok STT $0.00002778 pro Sekunde. Die vollständige Aufschlüsselung steht in der Preistabelle oben. Die Preise hängen von Abrechnungseinheit, Spezifikation und Nutzung ab. Vergleichen Sie gleiche Bedingungen in der detaillierten Preisliste des Modells; eine einzelne Rate bestimmt nicht die Gesamtkosten.

Welchen Endpunkt soll Grok STT verwenden?

Verwenden Sie https://api.tokenlab.sh/v1/audio/transcriptions für Grok STT. Das folgende Anforderungsbeispiel zeigt die passende Code-Struktur.

Welche Operationen unterstützt Grok STT?

Grok STT unterstützt Sprache zu Text. Wählen Sie oben einen Vorgang aus, um dessen Endpunkt und Anforderungsbeispiel anzuzeigen.

Grok STT vergleichen

Quellen

Geprüft am 02.10.2026

Mehr aus der Grok Voice-Serie

Ähnliche Modelle