Choisissez Auto, TokenLab Verified ou Official pour chaque demande, avec les prix affichés à l'avance.Voir les nouveautés

xAI: Grok Voice Think Fast 2.0

Grok Voice Think Fast 2.0 est un modèle vocal pour la conversation en direct. C'est un candidat pour les interfaces vocales où l'assistant doit suivre un échange en cours plutôt que de simplement lire un script préparé.
Comparer les modèles
grok-voice-think-fast-2.0
DisponiblexAIAudioSynchrone
Prix
À partir de $0.001333
Modalités
Audio

À propos de Grok Voice Think Fast 2.0

Grok Voice Think Fast 2.0 est le modèle vocal en temps réel de xAI conçu pour les conversations bidirectionnelles en direct, destiné aux assistants qui doivent suivre le rythme d'un interlocuteur plutôt que de lire un script préparé. Il s'agit du modèle versionné derrière l'alias grok-voice-latest. Utilisez cet identifiant exact lorsqu'un produit nécessite une version de modèle fixe pour ses réponses vocales.

Points forts

  • Il s'agit de la version fixe et numérotée derrière l'alias de l'agent vocal de xAI, de sorte que le comportement reste lié à un seul modèle jusqu'à ce que vous en changiez.
  • La détection d'activité vocale côté serveur gère la prise de parole, permettant au client de diffuser l'audio du microphone sans avoir besoin de sa propre logique de pause.
  • Les instructions par réponse permettent à une session de modifier l'invite système pour une seule réplique, par exemple pour changer de ton lors de l'explication d'un remboursement.
  • Les remplacements de prononciation corrigent la façon dont les noms et les termes de produits sont prononcés sans altérer la transcription.

Quand préférer un autre modèle

  • Il s'agit d'un modèle conversationnel de synthèse vocale (speech-to-speech) ; la transcription par lots de fichiers et la narration de longs textes sont mieux prises en charge par les modèles vocaux dédiés.
  • Le maintien d'une connexion ouverte pour l'audio en direct nécessite un client WebSocket ; un simple appel de requête-réponse ne suffira pas à le piloter.

Pour commencer

  1. Créer une clé API

    Générez une clé dans Console et utilisez-la avec tous les modèles de la plateforme.

  2. Envoyez votre première requête

    Copiez l'exemple pour votre langage et lancez-le.

    AudioChat Completions API
    POST/v1/chat/completions
    curl https://api.tokenlab.sh/v1/chat/completions \
      -H "Content-Type: application/json" \
      -H "Authorization: Bearer sk-xxx" \
      -d '{
        "model": "grok-voice-think-fast-2.0",
        "messages": [
          {"role": "user", "content": "Hello!"}
        ]
      }'

Tarification

Le tarif officiel est la référence publique du créateur du modèle. Le tarif TokenLab est ce que vous payez pour ce modèle sur TokenLab.

Audio Duration

par seconde
Tarif Official
$0.001333
Official
$0.001333
Remise
—

Utilisation et activité

Le taux de réussite est la part de requêtes abouties. La latence est la durée d'une réponse complète ; P95 signifie que 95 % des requêtes ont fini dans ce délai.

Utilisation et disponibilité

Dernières 24 heures
Requêtes
Taux de succès
Latence P95
Total des jetons
Performance du modèle
Les métriques s'affichent une fois les seuils de confidentialité et de volume de données atteints.

Les données sont basées sur les requêtes agrégées des utilisateurs, à l'exclusion des vérifications de statut.

Cas d'usage

  • Remplacement de serveur vocal interactif

    Remplacez les menus téléphoniques par un interlocuteur qui énonce simplement son problème, tandis que l'agent transfère l'appel ou le résout.

  • Partenaire de pratique linguistique

    Tenez un dialogue oral dans une langue cible, en corrigeant les erreurs à voix haute et en ajustant la vitesse à la demande de l'apprenant.

  • Assistant de terrain mains libres

    Permettez à un technicien de poser des questions sur un manuel par commande vocale et d'entendre les réponses tout en gardant les mains sur l'équipement.

Exemples de prompts

Vous êtes un agent de support calme pour un fournisseur d'accès Internet. Demandez le code postal du compte, puis guidez l'appelant dans le redémarrage du routeur.

Prononcez notre marque 'Zyntra' comme ZIN-tra, gardez un ton amical et n'interrompez jamais l'appelant au milieu d'une phrase.

Agissez comme un tuteur de portugais. Parlez lentement, répétez ma phrase corrigée et posez une question de suivi à chaque tour.

FAQ

Quelle est la différence entre grok-voice-think-fast-2.0 et grok-voice-latest ?

grok-voice-think-fast-2.0 est une version spécifique du modèle, tandis que grok-voice-latest est un alias qui pointe actuellement vers celle-ci. L'alias sera mis à jour vers les nouvelles versions ; le nom daté reste sur la version que vous avez testée.

Grok Voice Think Fast 2.0 est-il un modèle de synthèse vocale (text-to-speech) ?

Non. Il écoute et répond lors d'une session en direct, en recevant de l'audio et en produisant des réponses parlées. Pour transformer un texte préparé en audio, utilisez Grok Voice TTS ; pour transcrire des enregistrements, utilisez Grok Voice STT.

Comment décide-t-il que j'ai fini de parler ?

Les sessions peuvent activer la détection d'activité vocale côté serveur, qui détecte la fin du tour de parole de l'utilisateur et déclenche la réponse. Vous pouvez également gérer les tours vous-même si votre client dispose déjà d'une fonction push-to-talk.

Quelles voix peut-il utiliser ?

Une session peut choisir parmi les voix intégrées de xAI, avec 'eve' par défaut, ou une voix personnalisée clonée à partir d'un court enregistrement de référence. Les voix intégrées parlent toutes les langues prises en charge.

Combien coûte Grok Voice Think Fast 2.0 ?

Sur TokenLab, Grok Voice Think Fast 2.0 coûte $0.001333 par seconde. La table tarifaire ci-dessus en montre le détail complet. Les tarifs dépendent de l’unité de facturation, de la spécification et de l’usage. Comparez des conditions identiques dans la tarification détaillée du modèle ; un tarif seul ne détermine pas le coût total.

Quel endpoint Grok Voice Think Fast 2.0 doit-il utiliser ?

Utilisez https://api.tokenlab.sh/v1/chat/completions pour Grok Voice Think Fast 2.0. L'exemple de requête ci-dessous montre la structure de code correspondante.

Comparer Grok Voice Think Fast 2.0

Sources

Mis à jour le 2 oct. 2026

Plus de la série Grok Voice

Modèles associés