Wählen Sie Auto, TokenLab Verified oder Official für jede Anfrage, wobei die Preise vorab angezeigt werden.Neuigkeiten ansehen

xAI: Grok Voice Latest

Grok Voice Latest bietet eine konversationelle Sprachsitzung mit auswählbaren Stimmen und Tool-Interaktion. Es ist nützlich für gesprochene Assistenten, deren Antworten mit Aktionen und Informationen aus der umgebenden Anwendung verbunden bleiben müssen.
Modelle vergleichen
grok-voice-latest
VerfügbarxAIAudioSynchronAktuell
Preis
Ab $0.001333
Veröffentlicht
23. Apr. 2026
Modalitäten
Audio

Über Grok Voice Latest

Grok Voice Latest ist der fließende Alias von xAI für das aktuelle Echtzeit-Speech-to-Speech-Modell, das für gesprochene Konversationen über eine WebSocket-Sitzung verwendet wird. Zum Zeitpunkt der Überprüfung verweist er auf grok-voice-think-fast-2.0. Wählen Sie diesen Alias, wenn ein Sprachassistent von xAI-Verbesserungen profitieren soll, ohne dass eine Codeänderung erforderlich ist; fixieren Sie das versionierte Modell, wenn das Verhalten unverändert bleiben muss.

Stärken

  • Dies ist der von xAI empfohlene Alias für Sprachagenten, die automatisch Modell-Upgrades erhalten sollen, ohne dass die Sitzungskonfiguration geändert werden muss.
  • Eine Sitzung akzeptiert integrierte oder benutzerdefinierte Stimmen, serverseitige Spracherkennung für den Sprecherwechsel sowie Sprachhinweise für die Transkription.
  • Agenten können Web- und X-Suche, Dateisuche in Dokumentensammlungen, entfernte MCP-Server und benutzerdefinierte Funktionstools aufrufen.
  • Sitzungen können nach einem Verbindungsabbruch durch Wiederverwendung einer Konversations-ID fortgesetzt werden, was für Telefon- und Mobil-Clients geeignet ist.

Alternativen

  • Da sich der Alias ändert, können sich Stimme, Sprechtempo oder Wortwahl nach einem Upgrade verschieben; fixieren Sie das versionierte Modell für regressionsgetestete Produkte.
  • Es verarbeitet nur Live-Audiositzungen; für die Transkription gespeicherter Aufnahmen oder die Wiedergabe vorbereiteter Texte werden die Speech-to-Text- oder Text-to-Speech-Modelle benötigt.

Erste Schritte

  1. API-Schlüssel erstellen

    Erstelle einen Schlüssel in Console und nutze ihn mit jedem Modell auf der Plattform.

  2. Senden Sie Ihre erste Anfrage

    Kopieren Sie das Beispiel für Ihre Sprache und führen Sie es gegen den Endpunkt aus.

    EchtzeitWebSocket
    WS/v1/realtime
    // npm install ws
    import WebSocket from 'ws';
    
    const socket = new WebSocket("wss://api.tokenlab.sh/v1/realtime?model=grok-voice-latest", {
      headers: { Authorization: "Bearer sk-xxx" }
    });
    
    socket.on('open', () => {
      // Send the input events supported by this model with socket.send(...).
      // https://tokenlab.sh/docs/en/api-reference/realtime/connect
    });
    socket.on('message', (data) => console.log(data.toString()));
    socket.on('error', (error) => console.error(error));
    socket.on('close', (code, reason) => console.log(code, reason.toString()));
    
    // Close the session when finished.
    process.on('SIGINT', () => socket.close());

Preise

Der offizielle Preis ist die öffentliche Basisvorgabe des Modellerstellers. Der TokenLab-Preis ist das, was du für dieses Modell auf TokenLab zahlst.

Audio Duration

pro Sekunde
Offizieller Preis
$0.001333
Official
$0.001333
Rabatt
—

Nutzung & Aktivität

Die Erfolgsquote ist der Anteil abgeschlossener Anfragen. Die Latenz ist die Dauer einer vollständigen Antwort; P95 bedeutet, dass 95 % der Anfragen innerhalb dieser Zeit abgeschlossen wurden.

Nutzung & Verfügbarkeit

Letzte 24 Stunden
Anfragen
Erfolgsrate
P95-Latenz
Token gesamt
Modellleistung
Metriken erscheinen, sobald die Schwellenwerte für Datenschutz und Datenvolumen erreicht sind.

Die Daten basieren auf aggregierten Benutzeranfragen, Statusprüfungen sind ausgeschlossen.

In Console öffnen

Öffne Grok Voice Latest in Console mit einer bearbeitbaren oder versandbereiten Eingabeaufforderung.

Teste grok-voice-latest mit einer kurzen Audio-Anfrage an /v1/realtime. Zeige Ergebnis und Kosten.

Anwendungsfälle

  • Telefon- und Call-Center-Agenten

    Eingehende Anrufe über Telefonie-Codecs entgegennehmen, ein Konto über ein Funktionstool nachschlagen und den Anrufer an eine Person weiterleiten, wenn die Anfrage außerhalb der Richtlinien liegt.

  • In-App-Sprachassistent

    Ermöglichen Sie Benutzern, mit einem Produkt zu sprechen, wobei ephemere Token den API-Schlüssel vom Client fernhalten und Tools auf die Daten hinter der App zugreifen.

  • Skriptbasierte Offenlegungen innerhalb eines Live-Anrufs

    Fügen Sie eine erzwungene, feste Zeile für einen Compliance-Hinweis ein, während das Modell den Rest des Gesprächs übernimmt.

Prompt-Beispiele

Sie sind ein Buchungsassistent für eine Zahnklinik. Begrüßen Sie den Anrufer, fragen Sie nach dem Anliegen und bieten Sie die nächsten zwei freien Termine über das Kalendertool an.

Wechseln Sie ins Spanische, wenn der Anrufer dies tut, halten Sie Antworten unter zwei Sätzen und bestätigen Sie die Gesamtsumme der Bestellung, bevor Sie den Anruf beenden.

Durchsuchen Sie unsere Sammlung der Rückgaberichtlinien, beantworten Sie die Frage des Kunden laut und nennen Sie das verwendete Dokument.

FAQ

Welches Modell führt grok-voice-latest aus?

Es ist ein Alias, der derzeit auf grok-voice-think-fast-2.0 verweist, das Echtzeit-Speech-to-Speech-Modell in der Grok Voice-Suite von xAI. xAI empfiehlt die Verwendung des Alias, um Verbesserungen automatisch zu erhalten, sodass sich die zugrunde liegende Version im Laufe der Zeit ändern kann.

Wann sollte ich eine Version fixieren, anstatt den Alias zu verwenden?

Fixieren Sie das versionierte Modell, wenn Sie Prompts, Stimmenwahl und Tool-Verhalten getestet haben und diese stabil bleiben müssen. Verwenden Sie den Alias in Prototypen und Produkten, bei denen es wichtiger ist, Upgrades ohne erneute Bereitstellung zu erhalten, als eine exakte Wiederholbarkeit zu gewährleisten.

Welche Audioformate verwendet eine Sitzung?

Sitzungen übertragen PCM mit Abtastraten von 8 kHz bis 48 kHz, G.711 mu-law und A-law für Telefonie sowie Opus. Audio wird als base64-JSON-Nachrichten oder als binäre WebSocket-Frames übertragen.

Kann der Sprachagent Tools aufrufen?

Ja, gemäß der Sprachdokumentation von xAI: Web- und X-Suche, Dateisuche, entfernte MCP-Server und Ihre eigenen Funktionstools, die mit JSON-Schemas definiert sind. Stellen Sie sicher, dass Ihre Integration Tool-Definitionen in der Sitzungseinrichtung übergibt.

Kann ich eine Konversation nach einer Trennung beibehalten?

Ja. Die Sitzungsfortsetzung speichert frühere Gesprächsverläufe unter einer Konversations-ID, sodass ein Client, der nach einem Netzwerkabbruch die Verbindung wiederherstellt, denselben Dialog fortsetzen kann, anstatt von vorne zu beginnen.

Was kostet Grok Voice Latest?

Auf TokenLab kostet Grok Voice Latest $0.001333 pro Sekunde. Die vollständige Aufschlüsselung steht in der Preistabelle oben. Die Preise hängen von Abrechnungseinheit, Spezifikation und Nutzung ab. Vergleichen Sie gleiche Bedingungen in der detaillierten Preisliste des Modells; eine einzelne Rate bestimmt nicht die Gesamtkosten.

Welchen Endpunkt soll Grok Voice Latest verwenden?

Verwenden Sie https://api.tokenlab.sh/v1/realtime für Grok Voice Latest. Das folgende Anforderungsbeispiel zeigt die passende Code-Struktur.

Welche Operationen unterstützt Grok Voice Latest?

Grok Voice Latest unterstützt Echtzeit. Wählen Sie oben einen Vorgang aus, um dessen Endpunkt und Anforderungsbeispiel anzuzeigen.

Grok Voice Latest vergleichen

Anleitungen für Grok Voice Latest

Quellen

Geprüft am 02.10.2026

Mehr aus der Grok Voice-Serie

Ähnliche Modelle