Choisissez Auto, TokenLab Verified ou Official pour chaque demande, avec les prix affichés à l'avance.Voir les nouveautés

xAI: Grok Voice TTS

Grok Voice TTS crée de la parole à partir de texte écrit avec une voix et une langue choisies. Il convient à la narration localisée, aux notifications vocales et aux applications qui doivent rendre du texte préparé sous forme de réponse audio.
Comparer les modèles
grok-voice-tts
DisponiblexAITexte vers paroleSynchrone
Entrée / Sortie
$15.00 / $0.00
Modalités
Audio

À propos de Grok Voice TTS

Grok Voice TTS est le modèle de synthèse vocale de xAI, rendant le texte écrit sous forme d'audio parlé dans une voix et une langue choisies. Des balises intégrées telles que les pauses, les rires et les chuchotements façonnent le rendu. Utilisez-le pour la narration, les notifications vocales et les réponses audio localisées où le texte est déjà écrit et où aucune conversation en direct n'est nécessaire.

Points forts

  • Les balises vocales intégrées telles que [pause] et [laugh], ainsi que les balises d'enveloppement comme 'whisper', permettent un contrôle du rendu directement dans le texte.
  • Les voix intégrées parlent toutes les langues prises en charge, de sorte qu'une même identité vocale peut être utilisée pour des versions localisées du même contenu.
  • Les voix personnalisées peuvent être clonées à partir d'un court clip de référence pour des voix de marque ou de personnage.
  • Des horodatages au niveau des caractères peuvent être renvoyés pour synchroniser les sous-titres ou le mouvement des lèvres avec l'audio.

Quand préférer un autre modèle

  • Il prononce un texte fixe ; un appelant qui interrompt ou répond nécessite plutôt un modèle vocal conversationnel.
  • La qualité de sortie pour les longs scripts dépend de la ponctuation et des balises dans le texte source ; un texte brut non édité peut paraître monotone.

Pour commencer

  1. Créer une clé API

    Générez une clé dans Console et utilisez-la avec tous les modèles de la plateforme.

  2. Envoyez votre première requête

    Copiez l'exemple pour votre langage et lancez-le.

    Texte vers paroleEndpoint TokenLab
    POST/v1/audio/speech
    curl -X POST "https://api.tokenlab.sh/v1/audio/speech" \
      -H "Authorization: Bearer sk-xxx" \
      -H "Content-Type: application/json" \
      -d '{
      "language_code": "en",
      "operation": "tts",
      "response_format": "mp3",
      "voice": "eve",
      "model": "grok-voice-tts",
      "input": "Hello from TokenLab."
    }'

Tarification

Le tarif officiel est la référence publique du créateur du modèle. Le tarif TokenLab est ce que vous payez pour ce modèle sur TokenLab.

Tarification

Par million de caractères
Official
Entrée$15.00/1 M de caractèresSortie$0.00/1 M de caractères
Tarif Official
Entrée$15.00/1 M de caractèresSortie$0.00/1 M de caractères

Utilisation et activité

Le taux de réussite est la part de requêtes abouties. La latence est la durée d'une réponse complète ; P95 signifie que 95 % des requêtes ont fini dans ce délai.

Utilisation et disponibilité

Dernières 24 heures
Requêtes
Taux de succès
Latence P95
Total des jetons
Performance du modèle
Les métriques s'affichent une fois les seuils de confidentialité et de volume de données atteints.

Les données sont basées sur les requêtes agrégées des utilisateurs, à l'exclusion des vérifications de statut.

Ouvrir dans Console

Ouvrez Grok Voice TTS dans Console avec un prompt prêt à modifier ou envoyer.

Aide-moi à tester grok-voice-tts avec une requête audio sur /v1/audio/speech. Affiche le résultat et le coût.

Cas d'usage

  • Articles et leçons narrés

    Transformez un article fini ou un script de cours en piste audio, en utilisant des pauses pour séparer les sections.

  • Alertes vocales

    Lisez les mises à jour de commande ou les avis de sécurité dans la langue de l'utilisateur via un codec de téléphonie.

  • Vidéos de produits localisées

    Exprimez le même script dans plusieurs langues avec une voix choisie, puis utilisez les horodatages pour aligner les sous-titres.

Exemples de prompts

Lisez ce paragraphe d'une voix calme et posée et ajoutez une courte [pause] après chaque phrase.

Prononcez l'avis suivant en français, puis répétez-le en allemand, en utilisant la même voix.

<whisper>Votre colis a été expédié.</whisper> [pause] Il devrait arriver jeudi.

FAQ

Que fait Grok Voice TTS ?

Il convertit le texte en audio parlé. Vous choisissez une voix, éventuellement un code de langue et un format de sortie, et il renvoie l'audio correspondant au texte, incluant toutes les balises expressives que vous avez écrites.

Quels formats audio peut-il produire ?

MP3, WAV et PCM brut, ainsi que les codecs de téléphonie mu-law et A-law, avec des taux d'échantillonnage de 8 kHz à 48 kHz. Les codecs de téléphonie sont adaptés aux systèmes téléphoniques ; le MP3 convient à la lecture web et mobile.

Combien de langues peut-il parler ?

xAI documente vingt langues sélectionnées par code BCP-47, avec la détection automatique de langue comme alternative. Chaque voix intégrée peut parler toutes les langues prises en charge, donc changer de langue ne nécessite pas une nouvelle voix.

Puis-je diffuser l'audio pendant que le texte arrive encore ?

Oui. Un point de terminaison WebSocket génère l'audio en temps réel à mesure que le texte est envoyé, ce qui est utile lorsqu'un autre modèle est encore en train d'écrire la réponse qui sera prononcée.

Puis-je corriger les mots mal prononcés ?

Oui. Les remplacements de prononciation vous permettent de mapper un terme écrit à la façon dont il doit sonner, afin que les noms de marque et les acronymes soient corrects sans modifier le texte affiché.

Combien coûte Grok Voice TTS ?

Sur TokenLab, Grok Voice TTS coûte Entrée $15.00 / Sortie $0.00 Par million de caractères. La table tarifaire ci-dessus en montre le détail complet.

Quel endpoint Grok Voice TTS doit-il utiliser ?

Utilisez https://api.tokenlab.sh/v1/audio/speech pour Grok Voice TTS. L'exemple de requête ci-dessous montre la structure de code correspondante.

Quelles opérations Grok Voice TTS prend-il en charge ?

Grok Voice TTS prend en charge Texte vers parole. Sélectionnez une opération pour voir l'endpoint et un exemple.

Comparer Grok Voice TTS

Sources

Mis à jour le 2 oct. 2026

Plus de la série Grok Voice

Modèles associés