xAI: Grok Voice Think Fast 2.0
grok-voice-think-fast-2.0- Preis
- Ab $0.001333
- Modalitäten
- Audio
Über Grok Voice Think Fast 2.0
Grok Voice Think Fast 2.0 ist das Echtzeit-Sprachmodell von xAI für lebendige, wechselseitige Konversationen. Es wurde für Assistenten entwickelt, die mit einem Sprecher Schritt halten müssen, anstatt ein vorbereitetes Skript vorzulesen. Es ist das versionierte Modell hinter dem Alias grok-voice-latest. Verwenden Sie diese exakte ID, wenn ein Produkt eine feste Modellversion für seine gesprochenen Antworten benötigt.
Stärken
- Dies ist die feste, versionierte Version hinter dem Sprachagenten-Alias von xAI, sodass das Verhalten an ein Modell gebunden bleibt, bis Sie es ändern.
- Die serverseitige Spracherkennung steuert den Sprecherwechsel, sodass der Client Mikrofon-Audio ohne eigene Pausenlogik streamt.
- Anweisungen pro Antwort ermöglichen es einer Sitzung, den System-Prompt für eine einzelne Antwort zu ändern, um beispielsweise den Tonfall für eine Erläuterung zu einer Rückerstattung anzupassen.
- Aussprache-Ersetzungen korrigieren, wie Namen und Fachbegriffe ausgesprochen werden, ohne das Transkript zu verändern.
Alternativen
- Es handelt sich um ein konversationelles Speech-to-Speech-Modell; für die stapelweise Transkription von Dateien und das Vorlesen langer Texte sind die dedizierten Sprachmodelle besser geeignet.
- Um eine Verbindung für Live-Audio offen zu halten, ist ein WebSocket-Client erforderlich; ein einfacher Request-Response-Aufruf reicht hierfür nicht aus.
Erste Schritte
API-Schlüssel erstellen
Erstelle einen Schlüssel in Console und nutze ihn mit jedem Modell auf der Plattform.
Senden Sie Ihre erste Anfrage
Kopieren Sie das Beispiel für Ihre Sprache und führen Sie es gegen den Endpunkt aus.
AudioChat Completions APIPOST/v1/chat/completionscurl https://api.tokenlab.sh/v1/chat/completions \ -H "Content-Type: application/json" \ -H "Authorization: Bearer sk-xxx" \ -d '{ "model": "grok-voice-think-fast-2.0", "messages": [ {"role": "user", "content": "Hello!"} ] }'
Preise
Der offizielle Preis ist die öffentliche Basisvorgabe des Modellerstellers. Der TokenLab-Preis ist das, was du für dieses Modell auf TokenLab zahlst.
Audio Duration
pro Sekunde- Offizieller Preis
- $0.001333
- Official
- $0.001333
- Rabatt
- —
| Offizieller Preispro Sekunde | Officialpro Sekunde | Rabatt | |
|---|---|---|---|
| Audio Duration | $0.001333 | $0.001333 | — |
Nutzung & Aktivität
Die Erfolgsquote ist der Anteil abgeschlossener Anfragen. Die Latenz ist die Dauer einer vollständigen Antwort; P95 bedeutet, dass 95 % der Anfragen innerhalb dieser Zeit abgeschlossen wurden.
Nutzung & Verfügbarkeit
Letzte 24 Stunden- Anfragen
- Erfolgsrate
- P95-Latenz
- Token gesamt
Die Daten basieren auf aggregierten Benutzeranfragen, Statusprüfungen sind ausgeschlossen.
Anwendungsfälle
Ersatz für interaktive Sprachdialogsysteme (IVR)
Ersetzen Sie menügesteuerte Telefonbäume durch einen Anrufer, der das Problem einfach schildert, während der Agent den Anruf weiterleitet oder löst.
Partner für Sprachübungen
Führen Sie einen gesprochenen Dialog in einer Zielsprache, bei dem Fehler laut korrigiert und die Geschwindigkeit auf Wunsch des Lernenden angepasst wird.
Freihändiger Assistent vor Ort
Lassen Sie einen Techniker per Sprache Fragen zu einem Handbuch stellen und Antworten hören, während beide Hände an der Ausrüstung bleiben.
Prompt-Beispiele
Sie sind ein ruhiger Support-Mitarbeiter eines Internetanbieters. Fragen Sie nach der Postleitzahl des Kontos und führen Sie den Anrufer dann durch den Neustart des Routers.
Sprechen Sie unsere Marke 'Zyntra' als ZIN-tra aus, bewahren Sie einen freundlichen Tonfall und unterbrechen Sie den Anrufer niemals mitten im Satz.
Agieren Sie als Portugiesisch-Tutor. Sprechen Sie langsam, wiederholen Sie meinen korrigierten Satz und stellen Sie bei jedem Turn eine Folgefrage.
FAQ
Was ist der Unterschied zwischen grok-voice-think-fast-2.0 und grok-voice-latest?
grok-voice-think-fast-2.0 ist eine spezifische Modellversion, während grok-voice-latest ein Alias ist, der derzeit darauf verweist. Der Alias wird auf neuere Versionen aktualisiert; der datierte Name bleibt bei der Version, die Sie getestet haben.
Ist Grok Voice Think Fast 2.0 ein Text-to-Speech-Modell?
Nein. Es hört zu und antwortet in einer Live-Sitzung, indem es Audio empfängt und gesprochene Antworten erzeugt. Um vorbereiteten Text in Audio umzuwandeln, verwenden Sie Grok Voice TTS; für die Transkription von Aufnahmen verwenden Sie Grok Voice STT.
Wie entscheidet es, wann ich mit dem Sprechen fertig bin?
Sitzungen können eine serverseitige Spracherkennung aktivieren, die das Ende eines Benutzerbeitrags erkennt und die Antwort startet. Sie können die Sprecherwechsel auch selbst steuern, falls Ihr Client bereits über eine Push-to-Talk-Funktion verfügt.
Welche Stimmen können verwendet werden?
Eine Sitzung kann aus den integrierten Stimmen von xAI wählen, wobei 'eve' die Standardeinstellung ist, oder eine benutzerdefinierte Stimme verwenden, die aus einer kurzen Referenzaufnahme geklont wurde. Die integrierten Stimmen sprechen alle unterstützten Sprachen.
Was kostet Grok Voice Think Fast 2.0?
Auf TokenLab kostet Grok Voice Think Fast 2.0 $0.001333 pro Sekunde. Die vollständige Aufschlüsselung steht in der Preistabelle oben. Die Preise hängen von Abrechnungseinheit, Spezifikation und Nutzung ab. Vergleichen Sie gleiche Bedingungen in der detaillierten Preisliste des Modells; eine einzelne Rate bestimmt nicht die Gesamtkosten.
Welchen Endpunkt soll Grok Voice Think Fast 2.0 verwenden?
Verwenden Sie https://api.tokenlab.sh/v1/chat/completions für Grok Voice Think Fast 2.0. Das folgende Anforderungsbeispiel zeigt die passende Code-Struktur.
Grok Voice Think Fast 2.0 vergleichen
Quellen
Geprüft am 02.10.2026