xAI: Grok Voice Latest
grok-voice-latest- Preis
- Ab $0.001333
- Veröffentlicht
- 23. Apr. 2026
- Modalitäten
- Audio
Über Grok Voice Latest
Grok Voice Latest ist der fließende Alias von xAI für das aktuelle Echtzeit-Speech-to-Speech-Modell, das für gesprochene Konversationen über eine WebSocket-Sitzung verwendet wird. Zum Zeitpunkt der Überprüfung verweist er auf grok-voice-think-fast-2.0. Wählen Sie diesen Alias, wenn ein Sprachassistent von xAI-Verbesserungen profitieren soll, ohne dass eine Codeänderung erforderlich ist; fixieren Sie das versionierte Modell, wenn das Verhalten unverändert bleiben muss.
Stärken
- Dies ist der von xAI empfohlene Alias für Sprachagenten, die automatisch Modell-Upgrades erhalten sollen, ohne dass die Sitzungskonfiguration geändert werden muss.
- Eine Sitzung akzeptiert integrierte oder benutzerdefinierte Stimmen, serverseitige Spracherkennung für den Sprecherwechsel sowie Sprachhinweise für die Transkription.
- Agenten können Web- und X-Suche, Dateisuche in Dokumentensammlungen, entfernte MCP-Server und benutzerdefinierte Funktionstools aufrufen.
- Sitzungen können nach einem Verbindungsabbruch durch Wiederverwendung einer Konversations-ID fortgesetzt werden, was für Telefon- und Mobil-Clients geeignet ist.
Alternativen
- Da sich der Alias ändert, können sich Stimme, Sprechtempo oder Wortwahl nach einem Upgrade verschieben; fixieren Sie das versionierte Modell für regressionsgetestete Produkte.
- Es verarbeitet nur Live-Audiositzungen; für die Transkription gespeicherter Aufnahmen oder die Wiedergabe vorbereiteter Texte werden die Speech-to-Text- oder Text-to-Speech-Modelle benötigt.
Erste Schritte
API-Schlüssel erstellen
Erstelle einen Schlüssel in Console und nutze ihn mit jedem Modell auf der Plattform.
Senden Sie Ihre erste Anfrage
Kopieren Sie das Beispiel für Ihre Sprache und führen Sie es gegen den Endpunkt aus.
EchtzeitWebSocketWS/v1/realtime// npm install ws import WebSocket from 'ws'; const socket = new WebSocket("wss://api.tokenlab.sh/v1/realtime?model=grok-voice-latest", { headers: { Authorization: "Bearer sk-xxx" } }); socket.on('open', () => { // Send the input events supported by this model with socket.send(...). // https://tokenlab.sh/docs/en/api-reference/realtime/connect }); socket.on('message', (data) => console.log(data.toString())); socket.on('error', (error) => console.error(error)); socket.on('close', (code, reason) => console.log(code, reason.toString())); // Close the session when finished. process.on('SIGINT', () => socket.close());
Preise
Der offizielle Preis ist die öffentliche Basisvorgabe des Modellerstellers. Der TokenLab-Preis ist das, was du für dieses Modell auf TokenLab zahlst.
Audio Duration
pro Sekunde- Offizieller Preis
- $0.001333
- Official
- $0.001333
- Rabatt
- —
| Offizieller Preispro Sekunde | Officialpro Sekunde | Rabatt | |
|---|---|---|---|
| Audio Duration | $0.001333 | $0.001333 | — |
Nutzung & Aktivität
Die Erfolgsquote ist der Anteil abgeschlossener Anfragen. Die Latenz ist die Dauer einer vollständigen Antwort; P95 bedeutet, dass 95 % der Anfragen innerhalb dieser Zeit abgeschlossen wurden.
Nutzung & Verfügbarkeit
Letzte 24 Stunden- Anfragen
- Erfolgsrate
- P95-Latenz
- Token gesamt
Die Daten basieren auf aggregierten Benutzeranfragen, Statusprüfungen sind ausgeschlossen.
In Console öffnen
Öffne Grok Voice Latest in Console mit einer bearbeitbaren oder versandbereiten Eingabeaufforderung.
Teste grok-voice-latest mit einer kurzen Audio-Anfrage an /v1/realtime. Zeige Ergebnis und Kosten.
Anwendungsfälle
Telefon- und Call-Center-Agenten
Eingehende Anrufe über Telefonie-Codecs entgegennehmen, ein Konto über ein Funktionstool nachschlagen und den Anrufer an eine Person weiterleiten, wenn die Anfrage außerhalb der Richtlinien liegt.
In-App-Sprachassistent
Ermöglichen Sie Benutzern, mit einem Produkt zu sprechen, wobei ephemere Token den API-Schlüssel vom Client fernhalten und Tools auf die Daten hinter der App zugreifen.
Skriptbasierte Offenlegungen innerhalb eines Live-Anrufs
Fügen Sie eine erzwungene, feste Zeile für einen Compliance-Hinweis ein, während das Modell den Rest des Gesprächs übernimmt.
Prompt-Beispiele
Sie sind ein Buchungsassistent für eine Zahnklinik. Begrüßen Sie den Anrufer, fragen Sie nach dem Anliegen und bieten Sie die nächsten zwei freien Termine über das Kalendertool an.
Wechseln Sie ins Spanische, wenn der Anrufer dies tut, halten Sie Antworten unter zwei Sätzen und bestätigen Sie die Gesamtsumme der Bestellung, bevor Sie den Anruf beenden.
Durchsuchen Sie unsere Sammlung der Rückgaberichtlinien, beantworten Sie die Frage des Kunden laut und nennen Sie das verwendete Dokument.
FAQ
Welches Modell führt grok-voice-latest aus?
Es ist ein Alias, der derzeit auf grok-voice-think-fast-2.0 verweist, das Echtzeit-Speech-to-Speech-Modell in der Grok Voice-Suite von xAI. xAI empfiehlt die Verwendung des Alias, um Verbesserungen automatisch zu erhalten, sodass sich die zugrunde liegende Version im Laufe der Zeit ändern kann.
Wann sollte ich eine Version fixieren, anstatt den Alias zu verwenden?
Fixieren Sie das versionierte Modell, wenn Sie Prompts, Stimmenwahl und Tool-Verhalten getestet haben und diese stabil bleiben müssen. Verwenden Sie den Alias in Prototypen und Produkten, bei denen es wichtiger ist, Upgrades ohne erneute Bereitstellung zu erhalten, als eine exakte Wiederholbarkeit zu gewährleisten.
Welche Audioformate verwendet eine Sitzung?
Sitzungen übertragen PCM mit Abtastraten von 8 kHz bis 48 kHz, G.711 mu-law und A-law für Telefonie sowie Opus. Audio wird als base64-JSON-Nachrichten oder als binäre WebSocket-Frames übertragen.
Kann der Sprachagent Tools aufrufen?
Ja, gemäß der Sprachdokumentation von xAI: Web- und X-Suche, Dateisuche, entfernte MCP-Server und Ihre eigenen Funktionstools, die mit JSON-Schemas definiert sind. Stellen Sie sicher, dass Ihre Integration Tool-Definitionen in der Sitzungseinrichtung übergibt.
Kann ich eine Konversation nach einer Trennung beibehalten?
Ja. Die Sitzungsfortsetzung speichert frühere Gesprächsverläufe unter einer Konversations-ID, sodass ein Client, der nach einem Netzwerkabbruch die Verbindung wiederherstellt, denselben Dialog fortsetzen kann, anstatt von vorne zu beginnen.
Was kostet Grok Voice Latest?
Auf TokenLab kostet Grok Voice Latest $0.001333 pro Sekunde. Die vollständige Aufschlüsselung steht in der Preistabelle oben. Die Preise hängen von Abrechnungseinheit, Spezifikation und Nutzung ab. Vergleichen Sie gleiche Bedingungen in der detaillierten Preisliste des Modells; eine einzelne Rate bestimmt nicht die Gesamtkosten.
Welchen Endpunkt soll Grok Voice Latest verwenden?
Verwenden Sie https://api.tokenlab.sh/v1/realtime für Grok Voice Latest. Das folgende Anforderungsbeispiel zeigt die passende Code-Struktur.
Welche Operationen unterstützt Grok Voice Latest?
Grok Voice Latest unterstützt Echtzeit. Wählen Sie oben einen Vorgang aus, um dessen Endpunkt und Anforderungsbeispiel anzuzeigen.
Grok Voice Latest vergleichen
Anleitungen für Grok Voice Latest
Quellen
Geprüft am 02.10.2026