xAI: Grok Voice TTS
grok-voice-tts- Entrée / Sortie
- $15.00 / $0.00
- Modalités
- Audio
À propos de Grok Voice TTS
Grok Voice TTS est le modèle de synthèse vocale de xAI, rendant le texte écrit sous forme d'audio parlé dans une voix et une langue choisies. Des balises intégrées telles que les pauses, les rires et les chuchotements façonnent le rendu. Utilisez-le pour la narration, les notifications vocales et les réponses audio localisées où le texte est déjà écrit et où aucune conversation en direct n'est nécessaire.
Points forts
- Les balises vocales intégrées telles que [pause] et [laugh], ainsi que les balises d'enveloppement comme 'whisper', permettent un contrôle du rendu directement dans le texte.
- Les voix intégrées parlent toutes les langues prises en charge, de sorte qu'une même identité vocale peut être utilisée pour des versions localisées du même contenu.
- Les voix personnalisées peuvent être clonées à partir d'un court clip de référence pour des voix de marque ou de personnage.
- Des horodatages au niveau des caractères peuvent être renvoyés pour synchroniser les sous-titres ou le mouvement des lèvres avec l'audio.
Quand préférer un autre modèle
- Il prononce un texte fixe ; un appelant qui interrompt ou répond nécessite plutôt un modèle vocal conversationnel.
- La qualité de sortie pour les longs scripts dépend de la ponctuation et des balises dans le texte source ; un texte brut non édité peut paraître monotone.
Pour commencer
Créer une clé API
Générez une clé dans Console et utilisez-la avec tous les modèles de la plateforme.
Envoyez votre première requête
Copiez l'exemple pour votre langage et lancez-le.
Texte vers paroleEndpoint TokenLabPOST/v1/audio/speechcurl -X POST "https://api.tokenlab.sh/v1/audio/speech" \ -H "Authorization: Bearer sk-xxx" \ -H "Content-Type: application/json" \ -d '{ "language_code": "en", "operation": "tts", "response_format": "mp3", "voice": "eve", "model": "grok-voice-tts", "input": "Hello from TokenLab." }'
Tarification
Le tarif officiel est la référence publique du créateur du modèle. Le tarif TokenLab est ce que vous payez pour ce modèle sur TokenLab.
Tarification
Par million de caractères- Official
- Entrée$15.00/1 M de caractèresSortie$0.00/1 M de caractères
- Tarif Official
- Entrée$15.00/1 M de caractèresSortie$0.00/1 M de caractères
| Tarif OfficialPar million de caractères | OfficialPar million de caractères | Remise | |
|---|---|---|---|
| Entrée | $15.00 | $15.00 | — |
| Sortie | $0.00 | $0.00 | — |
Utilisation et activité
Le taux de réussite est la part de requêtes abouties. La latence est la durée d'une réponse complète ; P95 signifie que 95 % des requêtes ont fini dans ce délai.
Utilisation et disponibilité
Dernières 24 heures- Requêtes
- Taux de succès
- Latence P95
- Total des jetons
Les données sont basées sur les requêtes agrégées des utilisateurs, à l'exclusion des vérifications de statut.
Ouvrir dans Console
Ouvrez Grok Voice TTS dans Console avec un prompt prêt à modifier ou envoyer.
Aide-moi à tester grok-voice-tts avec une requête audio sur /v1/audio/speech. Affiche le résultat et le coût.
Cas d'usage
Articles et leçons narrés
Transformez un article fini ou un script de cours en piste audio, en utilisant des pauses pour séparer les sections.
Alertes vocales
Lisez les mises à jour de commande ou les avis de sécurité dans la langue de l'utilisateur via un codec de téléphonie.
Vidéos de produits localisées
Exprimez le même script dans plusieurs langues avec une voix choisie, puis utilisez les horodatages pour aligner les sous-titres.
Exemples de prompts
Lisez ce paragraphe d'une voix calme et posée et ajoutez une courte [pause] après chaque phrase.
Prononcez l'avis suivant en français, puis répétez-le en allemand, en utilisant la même voix.
<whisper>Votre colis a été expédié.</whisper> [pause] Il devrait arriver jeudi.
FAQ
Que fait Grok Voice TTS ?
Il convertit le texte en audio parlé. Vous choisissez une voix, éventuellement un code de langue et un format de sortie, et il renvoie l'audio correspondant au texte, incluant toutes les balises expressives que vous avez écrites.
Quels formats audio peut-il produire ?
MP3, WAV et PCM brut, ainsi que les codecs de téléphonie mu-law et A-law, avec des taux d'échantillonnage de 8 kHz à 48 kHz. Les codecs de téléphonie sont adaptés aux systèmes téléphoniques ; le MP3 convient à la lecture web et mobile.
Combien de langues peut-il parler ?
xAI documente vingt langues sélectionnées par code BCP-47, avec la détection automatique de langue comme alternative. Chaque voix intégrée peut parler toutes les langues prises en charge, donc changer de langue ne nécessite pas une nouvelle voix.
Puis-je diffuser l'audio pendant que le texte arrive encore ?
Oui. Un point de terminaison WebSocket génère l'audio en temps réel à mesure que le texte est envoyé, ce qui est utile lorsqu'un autre modèle est encore en train d'écrire la réponse qui sera prononcée.
Puis-je corriger les mots mal prononcés ?
Oui. Les remplacements de prononciation vous permettent de mapper un terme écrit à la façon dont il doit sonner, afin que les noms de marque et les acronymes soient corrects sans modifier le texte affiché.
Combien coûte Grok Voice TTS ?
Sur TokenLab, Grok Voice TTS coûte Entrée $15.00 / Sortie $0.00 Par million de caractères. La table tarifaire ci-dessus en montre le détail complet.
Quel endpoint Grok Voice TTS doit-il utiliser ?
Utilisez https://api.tokenlab.sh/v1/audio/speech pour Grok Voice TTS. L'exemple de requête ci-dessous montre la structure de code correspondante.
Quelles opérations Grok Voice TTS prend-il en charge ?
Grok Voice TTS prend en charge Texte vers parole. Sélectionnez une opération pour voir l'endpoint et un exemple.
Comparer Grok Voice TTS
Sources
Mis à jour le 2 oct. 2026