xAI: Grok Voice TTS
grok-voice-tts- Eingabe / Ausgabe
- $15.00 / $0.00
- Modalitäten
- Audio
Über Grok Voice TTS
Grok Voice TTS ist das Text-to-Speech-Modell von xAI, das geschriebenen Text in einer gewählten Stimme und Sprache als gesprochenes Audio wiedergibt. Inline-Tags wie Pausen, Lachen und Flüstern gestalten die Sprachausgabe. Verwenden Sie es für Vertonungen, gesprochene Benachrichtigungen und lokalisierte Audioantworten, bei denen der Text bereits geschrieben ist und keine Live-Konversation erforderlich ist.
Stärken
- Inline-Sprach-Tags wie [pause] und [laugh] sowie umschließende Tags wie 'whisper' ermöglichen die Steuerung der Sprachausgabe direkt im Text.
- Alle integrierten Stimmen sprechen die unterstützten Sprachen, sodass eine Stimmenidentität über lokalisierte Versionen desselben Inhalts hinweg beibehalten werden kann.
- Benutzerdefinierte Stimmen können für Marken- oder Charakterstimmen aus einem kurzen Referenzclip geklont werden.
- Zeichenbasierte Zeitstempel können zurückgegeben werden, um Untertitel oder Lippenbewegungen mit dem Audio zu synchronisieren.
Alternativen
- Es spricht festen Text; ein Anrufer, der unterbricht oder antwortet, benötigt stattdessen ein konversationelles Sprachmodell.
- Die Ausgabequalität für lange Skripte hängt von der Zeichensetzung und den Tags im Quelltext ab, daher kann unbearbeiteter Maschinentext monoton klingen.
Erste Schritte
API-Schlüssel erstellen
Erstelle einen Schlüssel in Console und nutze ihn mit jedem Modell auf der Plattform.
Senden Sie Ihre erste Anfrage
Kopieren Sie das Beispiel für Ihre Sprache und führen Sie es gegen den Endpunkt aus.
Text zu SpracheTokenLab-EndpunktPOST/v1/audio/speechcurl -X POST "https://api.tokenlab.sh/v1/audio/speech" \ -H "Authorization: Bearer sk-xxx" \ -H "Content-Type: application/json" \ -d '{ "language_code": "en", "operation": "tts", "response_format": "mp3", "voice": "eve", "model": "grok-voice-tts", "input": "Hello from TokenLab." }'
Preise
Der offizielle Preis ist die öffentliche Basisvorgabe des Modellerstellers. Der TokenLab-Preis ist das, was du für dieses Modell auf TokenLab zahlst.
Preise
Pro 1 Mio. Zeichen- Official
- Eingabe$15.00/1 Mio. ZeichenAusgabe$0.00/1 Mio. Zeichen
- Offizieller Preis
- Eingabe$15.00/1 Mio. ZeichenAusgabe$0.00/1 Mio. Zeichen
| Offizieller PreisPro 1 Mio. Zeichen | OfficialPro 1 Mio. Zeichen | Rabatt | |
|---|---|---|---|
| Eingabe | $15.00 | $15.00 | — |
| Ausgabe | $0.00 | $0.00 | — |
Nutzung & Aktivität
Die Erfolgsquote ist der Anteil abgeschlossener Anfragen. Die Latenz ist die Dauer einer vollständigen Antwort; P95 bedeutet, dass 95 % der Anfragen innerhalb dieser Zeit abgeschlossen wurden.
Nutzung & Verfügbarkeit
Letzte 24 Stunden- Anfragen
- Erfolgsrate
- P95-Latenz
- Token gesamt
Die Daten basieren auf aggregierten Benutzeranfragen, Statusprüfungen sind ausgeschlossen.
In Console öffnen
Öffne Grok Voice TTS in Console mit einer bearbeitbaren oder versandbereiten Eingabeaufforderung.
Teste grok-voice-tts mit einer kurzen Audio-Anfrage an /v1/audio/speech. Zeige Ergebnis und Kosten.
Anwendungsfälle
Vertonte Artikel und Lektionen
Wandeln Sie einen fertigen Artikel oder ein Kursskript in eine Audiospur um und verwenden Sie Pausen, um Abschnitte zu trennen.
Gesprochene Warnmeldungen
Lesen Sie Bestellaktualisierungen oder Sicherheitshinweise in der Sprache des Benutzers über einen Telefonie-Codec vor.
Lokalisierte Produktvideos
Vertonen Sie dasselbe Skript in mehreren Sprachen mit einer gewählten Stimme und verwenden Sie dann Zeitstempel, um Untertitel auszurichten.
Prompt-Beispiele
Lesen Sie diesen Absatz mit einer warmen, ruhigen Stimme und fügen Sie nach jedem Satz eine kurze [pause] ein.
Sprechen Sie den folgenden Hinweis auf Französisch und wiederholen Sie ihn dann auf Deutsch, wobei Sie dieselbe Stimme verwenden.
<whisper>Ihr Paket wurde versandt.</whisper> [pause] Es sollte am Donnerstag ankommen.
FAQ
Was macht Grok Voice TTS?
Es wandelt Text in Sprachaudio um. Sie wählen eine Stimme, optional einen Sprachcode und ein Ausgabeformat, und es gibt Audio für den Text zurück, einschließlich aller ausdrucksstarken Tags, die Sie inline geschrieben haben.
Welche Audioformate können erzeugt werden?
MP3, WAV und rohes PCM sowie die Telefonie-Codecs mu-law und A-law bei Abtastraten von 8 kHz bis 48 kHz. Telefonie-Codecs eignen sich für Telefonsysteme; MP3 eignet sich für Web- und Mobilwiedergabe.
Wie viele Sprachen kann es sprechen?
xAI dokumentiert zwanzig Sprachen, die nach BCP-47-Code ausgewählt werden, wobei eine automatische Spracherkennung als Alternative dient. Jede integrierte Stimme kann alle unterstützten Sprachen sprechen, sodass für einen Sprachwechsel keine neue Stimme erforderlich ist.
Kann ich Audio streamen, während der Text noch eintrifft?
Ja. Ein WebSocket-Endpunkt generiert Audio in Echtzeit, während Text gesendet wird, was hilfreich ist, wenn ein anderes Modell noch an der Antwort schreibt, die gesprochen werden soll.
Kann ich falsch ausgesprochene Wörter korrigieren?
Ja. Aussprache-Ersetzungen ermöglichen es Ihnen, einen geschriebenen Begriff so zuzuordnen, wie er klingen soll, sodass Markennamen und Akronyme korrekt ausgesprochen werden, ohne den angezeigten Text zu bearbeiten.
Was kostet Grok Voice TTS?
Auf TokenLab kostet Grok Voice TTS Eingabe $15.00 / Ausgabe $0.00 Pro 1 Mio. Zeichen. Die vollständige Aufschlüsselung steht in der Preistabelle oben.
Welchen Endpunkt soll Grok Voice TTS verwenden?
Verwenden Sie https://api.tokenlab.sh/v1/audio/speech für Grok Voice TTS. Das folgende Anforderungsbeispiel zeigt die passende Code-Struktur.
Welche Operationen unterstützt Grok Voice TTS?
Grok Voice TTS unterstützt Text zu Sprache. Wählen Sie oben einen Vorgang aus, um dessen Endpunkt und Anforderungsbeispiel anzuzeigen.
Grok Voice TTS vergleichen
Quellen
Geprüft am 02.10.2026