Wählen Sie Auto, TokenLab Verified oder Official für jede Anfrage, wobei die Preise vorab angezeigt werden.Neuigkeiten ansehen

xAI: Grok Voice Think Fast 2.0

Grok Voice Think Fast 2.0 ist ein Sprachmodell für Live-Konversationen. Es ist ein Kandidat für gesprochene Schnittstellen, bei denen der Assistent mit einem laufenden Austausch Schritt halten muss, anstatt nur ein vorbereitetes Skript vorzulesen.
Modelle vergleichen
grok-voice-think-fast-2.0
VerfügbarxAIAudioSynchron
Preis
Ab $0.001333
Modalitäten
Audio

Über Grok Voice Think Fast 2.0

Grok Voice Think Fast 2.0 ist das Echtzeit-Sprachmodell von xAI für lebendige, wechselseitige Konversationen. Es wurde für Assistenten entwickelt, die mit einem Sprecher Schritt halten müssen, anstatt ein vorbereitetes Skript vorzulesen. Es ist das versionierte Modell hinter dem Alias grok-voice-latest. Verwenden Sie diese exakte ID, wenn ein Produkt eine feste Modellversion für seine gesprochenen Antworten benötigt.

Stärken

  • Dies ist die feste, versionierte Version hinter dem Sprachagenten-Alias von xAI, sodass das Verhalten an ein Modell gebunden bleibt, bis Sie es ändern.
  • Die serverseitige Spracherkennung steuert den Sprecherwechsel, sodass der Client Mikrofon-Audio ohne eigene Pausenlogik streamt.
  • Anweisungen pro Antwort ermöglichen es einer Sitzung, den System-Prompt für eine einzelne Antwort zu ändern, um beispielsweise den Tonfall für eine Erläuterung zu einer Rückerstattung anzupassen.
  • Aussprache-Ersetzungen korrigieren, wie Namen und Fachbegriffe ausgesprochen werden, ohne das Transkript zu verändern.

Alternativen

  • Es handelt sich um ein konversationelles Speech-to-Speech-Modell; für die stapelweise Transkription von Dateien und das Vorlesen langer Texte sind die dedizierten Sprachmodelle besser geeignet.
  • Um eine Verbindung für Live-Audio offen zu halten, ist ein WebSocket-Client erforderlich; ein einfacher Request-Response-Aufruf reicht hierfür nicht aus.

Erste Schritte

  1. API-Schlüssel erstellen

    Erstelle einen Schlüssel in Console und nutze ihn mit jedem Modell auf der Plattform.

  2. Senden Sie Ihre erste Anfrage

    Kopieren Sie das Beispiel für Ihre Sprache und führen Sie es gegen den Endpunkt aus.

    AudioChat Completions API
    POST/v1/chat/completions
    curl https://api.tokenlab.sh/v1/chat/completions \
      -H "Content-Type: application/json" \
      -H "Authorization: Bearer sk-xxx" \
      -d '{
        "model": "grok-voice-think-fast-2.0",
        "messages": [
          {"role": "user", "content": "Hello!"}
        ]
      }'

Preise

Der offizielle Preis ist die öffentliche Basisvorgabe des Modellerstellers. Der TokenLab-Preis ist das, was du für dieses Modell auf TokenLab zahlst.

Audio Duration

pro Sekunde
Offizieller Preis
$0.001333
Official
$0.001333
Rabatt
—

Nutzung & Aktivität

Die Erfolgsquote ist der Anteil abgeschlossener Anfragen. Die Latenz ist die Dauer einer vollständigen Antwort; P95 bedeutet, dass 95 % der Anfragen innerhalb dieser Zeit abgeschlossen wurden.

Nutzung & Verfügbarkeit

Letzte 24 Stunden
Anfragen
Erfolgsrate
P95-Latenz
Token gesamt
Modellleistung
Metriken erscheinen, sobald die Schwellenwerte für Datenschutz und Datenvolumen erreicht sind.

Die Daten basieren auf aggregierten Benutzeranfragen, Statusprüfungen sind ausgeschlossen.

Anwendungsfälle

  • Ersatz für interaktive Sprachdialogsysteme (IVR)

    Ersetzen Sie menügesteuerte Telefonbäume durch einen Anrufer, der das Problem einfach schildert, während der Agent den Anruf weiterleitet oder löst.

  • Partner für Sprachübungen

    Führen Sie einen gesprochenen Dialog in einer Zielsprache, bei dem Fehler laut korrigiert und die Geschwindigkeit auf Wunsch des Lernenden angepasst wird.

  • Freihändiger Assistent vor Ort

    Lassen Sie einen Techniker per Sprache Fragen zu einem Handbuch stellen und Antworten hören, während beide Hände an der Ausrüstung bleiben.

Prompt-Beispiele

Sie sind ein ruhiger Support-Mitarbeiter eines Internetanbieters. Fragen Sie nach der Postleitzahl des Kontos und führen Sie den Anrufer dann durch den Neustart des Routers.

Sprechen Sie unsere Marke 'Zyntra' als ZIN-tra aus, bewahren Sie einen freundlichen Tonfall und unterbrechen Sie den Anrufer niemals mitten im Satz.

Agieren Sie als Portugiesisch-Tutor. Sprechen Sie langsam, wiederholen Sie meinen korrigierten Satz und stellen Sie bei jedem Turn eine Folgefrage.

FAQ

Was ist der Unterschied zwischen grok-voice-think-fast-2.0 und grok-voice-latest?

grok-voice-think-fast-2.0 ist eine spezifische Modellversion, während grok-voice-latest ein Alias ist, der derzeit darauf verweist. Der Alias wird auf neuere Versionen aktualisiert; der datierte Name bleibt bei der Version, die Sie getestet haben.

Ist Grok Voice Think Fast 2.0 ein Text-to-Speech-Modell?

Nein. Es hört zu und antwortet in einer Live-Sitzung, indem es Audio empfängt und gesprochene Antworten erzeugt. Um vorbereiteten Text in Audio umzuwandeln, verwenden Sie Grok Voice TTS; für die Transkription von Aufnahmen verwenden Sie Grok Voice STT.

Wie entscheidet es, wann ich mit dem Sprechen fertig bin?

Sitzungen können eine serverseitige Spracherkennung aktivieren, die das Ende eines Benutzerbeitrags erkennt und die Antwort startet. Sie können die Sprecherwechsel auch selbst steuern, falls Ihr Client bereits über eine Push-to-Talk-Funktion verfügt.

Welche Stimmen können verwendet werden?

Eine Sitzung kann aus den integrierten Stimmen von xAI wählen, wobei 'eve' die Standardeinstellung ist, oder eine benutzerdefinierte Stimme verwenden, die aus einer kurzen Referenzaufnahme geklont wurde. Die integrierten Stimmen sprechen alle unterstützten Sprachen.

Was kostet Grok Voice Think Fast 2.0?

Auf TokenLab kostet Grok Voice Think Fast 2.0 $0.001333 pro Sekunde. Die vollständige Aufschlüsselung steht in der Preistabelle oben. Die Preise hängen von Abrechnungseinheit, Spezifikation und Nutzung ab. Vergleichen Sie gleiche Bedingungen in der detaillierten Preisliste des Modells; eine einzelne Rate bestimmt nicht die Gesamtkosten.

Welchen Endpunkt soll Grok Voice Think Fast 2.0 verwenden?

Verwenden Sie https://api.tokenlab.sh/v1/chat/completions für Grok Voice Think Fast 2.0. Das folgende Anforderungsbeispiel zeigt die passende Code-Struktur.

Grok Voice Think Fast 2.0 vergleichen

Quellen

Geprüft am 02.10.2026

Mehr aus der Grok Voice-Serie

Ähnliche Modelle