Wählen Sie Auto, TokenLab Verified oder Official für jede Anfrage, wobei die Preise vorab angezeigt werden.Neuigkeiten ansehen

xAI: Grok Voice TTS

Grok Voice TTS erstellt Sprache aus geschriebenem Text mit einer gewählten Stimme und Sprache. Es eignet sich für lokalisierte Erzählungen, gesprochene Benachrichtigungen und Anwendungen, die vorbereiteten Text als Audioantwort wiedergeben müssen.
Modelle vergleichen
grok-voice-tts
VerfügbarxAIText zu SpracheSynchron
Eingabe / Ausgabe
$15.00 / $0.00
Modalitäten
Audio

Über Grok Voice TTS

Grok Voice TTS ist das Text-to-Speech-Modell von xAI, das geschriebenen Text in einer gewählten Stimme und Sprache als gesprochenes Audio wiedergibt. Inline-Tags wie Pausen, Lachen und Flüstern gestalten die Sprachausgabe. Verwenden Sie es für Vertonungen, gesprochene Benachrichtigungen und lokalisierte Audioantworten, bei denen der Text bereits geschrieben ist und keine Live-Konversation erforderlich ist.

Stärken

  • Inline-Sprach-Tags wie [pause] und [laugh] sowie umschließende Tags wie 'whisper' ermöglichen die Steuerung der Sprachausgabe direkt im Text.
  • Alle integrierten Stimmen sprechen die unterstützten Sprachen, sodass eine Stimmenidentität über lokalisierte Versionen desselben Inhalts hinweg beibehalten werden kann.
  • Benutzerdefinierte Stimmen können für Marken- oder Charakterstimmen aus einem kurzen Referenzclip geklont werden.
  • Zeichenbasierte Zeitstempel können zurückgegeben werden, um Untertitel oder Lippenbewegungen mit dem Audio zu synchronisieren.

Alternativen

  • Es spricht festen Text; ein Anrufer, der unterbricht oder antwortet, benötigt stattdessen ein konversationelles Sprachmodell.
  • Die Ausgabequalität für lange Skripte hängt von der Zeichensetzung und den Tags im Quelltext ab, daher kann unbearbeiteter Maschinentext monoton klingen.

Erste Schritte

  1. API-Schlüssel erstellen

    Erstelle einen Schlüssel in Console und nutze ihn mit jedem Modell auf der Plattform.

  2. Senden Sie Ihre erste Anfrage

    Kopieren Sie das Beispiel für Ihre Sprache und führen Sie es gegen den Endpunkt aus.

    Text zu SpracheTokenLab-Endpunkt
    POST/v1/audio/speech
    curl -X POST "https://api.tokenlab.sh/v1/audio/speech" \
      -H "Authorization: Bearer sk-xxx" \
      -H "Content-Type: application/json" \
      -d '{
      "language_code": "en",
      "operation": "tts",
      "response_format": "mp3",
      "voice": "eve",
      "model": "grok-voice-tts",
      "input": "Hello from TokenLab."
    }'

Preise

Der offizielle Preis ist die öffentliche Basisvorgabe des Modellerstellers. Der TokenLab-Preis ist das, was du für dieses Modell auf TokenLab zahlst.

Preise

Pro 1 Mio. Zeichen
Official
Eingabe$15.00/1 Mio. ZeichenAusgabe$0.00/1 Mio. Zeichen
Offizieller Preis
Eingabe$15.00/1 Mio. ZeichenAusgabe$0.00/1 Mio. Zeichen

Nutzung & Aktivität

Die Erfolgsquote ist der Anteil abgeschlossener Anfragen. Die Latenz ist die Dauer einer vollständigen Antwort; P95 bedeutet, dass 95 % der Anfragen innerhalb dieser Zeit abgeschlossen wurden.

Nutzung & Verfügbarkeit

Letzte 24 Stunden
Anfragen
Erfolgsrate
P95-Latenz
Token gesamt
Modellleistung
Metriken erscheinen, sobald die Schwellenwerte für Datenschutz und Datenvolumen erreicht sind.

Die Daten basieren auf aggregierten Benutzeranfragen, Statusprüfungen sind ausgeschlossen.

In Console öffnen

Öffne Grok Voice TTS in Console mit einer bearbeitbaren oder versandbereiten Eingabeaufforderung.

Teste grok-voice-tts mit einer kurzen Audio-Anfrage an /v1/audio/speech. Zeige Ergebnis und Kosten.

Anwendungsfälle

  • Vertonte Artikel und Lektionen

    Wandeln Sie einen fertigen Artikel oder ein Kursskript in eine Audiospur um und verwenden Sie Pausen, um Abschnitte zu trennen.

  • Gesprochene Warnmeldungen

    Lesen Sie Bestellaktualisierungen oder Sicherheitshinweise in der Sprache des Benutzers über einen Telefonie-Codec vor.

  • Lokalisierte Produktvideos

    Vertonen Sie dasselbe Skript in mehreren Sprachen mit einer gewählten Stimme und verwenden Sie dann Zeitstempel, um Untertitel auszurichten.

Prompt-Beispiele

Lesen Sie diesen Absatz mit einer warmen, ruhigen Stimme und fügen Sie nach jedem Satz eine kurze [pause] ein.

Sprechen Sie den folgenden Hinweis auf Französisch und wiederholen Sie ihn dann auf Deutsch, wobei Sie dieselbe Stimme verwenden.

<whisper>Ihr Paket wurde versandt.</whisper> [pause] Es sollte am Donnerstag ankommen.

FAQ

Was macht Grok Voice TTS?

Es wandelt Text in Sprachaudio um. Sie wählen eine Stimme, optional einen Sprachcode und ein Ausgabeformat, und es gibt Audio für den Text zurück, einschließlich aller ausdrucksstarken Tags, die Sie inline geschrieben haben.

Welche Audioformate können erzeugt werden?

MP3, WAV und rohes PCM sowie die Telefonie-Codecs mu-law und A-law bei Abtastraten von 8 kHz bis 48 kHz. Telefonie-Codecs eignen sich für Telefonsysteme; MP3 eignet sich für Web- und Mobilwiedergabe.

Wie viele Sprachen kann es sprechen?

xAI dokumentiert zwanzig Sprachen, die nach BCP-47-Code ausgewählt werden, wobei eine automatische Spracherkennung als Alternative dient. Jede integrierte Stimme kann alle unterstützten Sprachen sprechen, sodass für einen Sprachwechsel keine neue Stimme erforderlich ist.

Kann ich Audio streamen, während der Text noch eintrifft?

Ja. Ein WebSocket-Endpunkt generiert Audio in Echtzeit, während Text gesendet wird, was hilfreich ist, wenn ein anderes Modell noch an der Antwort schreibt, die gesprochen werden soll.

Kann ich falsch ausgesprochene Wörter korrigieren?

Ja. Aussprache-Ersetzungen ermöglichen es Ihnen, einen geschriebenen Begriff so zuzuordnen, wie er klingen soll, sodass Markennamen und Akronyme korrekt ausgesprochen werden, ohne den angezeigten Text zu bearbeiten.

Was kostet Grok Voice TTS?

Auf TokenLab kostet Grok Voice TTS Eingabe $15.00 / Ausgabe $0.00 Pro 1 Mio. Zeichen. Die vollständige Aufschlüsselung steht in der Preistabelle oben.

Welchen Endpunkt soll Grok Voice TTS verwenden?

Verwenden Sie https://api.tokenlab.sh/v1/audio/speech für Grok Voice TTS. Das folgende Anforderungsbeispiel zeigt die passende Code-Struktur.

Welche Operationen unterstützt Grok Voice TTS?

Grok Voice TTS unterstützt Text zu Sprache. Wählen Sie oben einen Vorgang aus, um dessen Endpunkt und Anforderungsbeispiel anzuzeigen.

Grok Voice TTS vergleichen

Quellen

Geprüft am 02.10.2026

Mehr aus der Grok Voice-Serie

Ähnliche Modelle