xAI: Grok Voice Think Fast 2.0
grok-voice-think-fast-2.0- Prix
- À partir de $0.001333
- Modalités
- Audio
À propos de Grok Voice Think Fast 2.0
Grok Voice Think Fast 2.0 est le modèle vocal en temps réel de xAI conçu pour les conversations bidirectionnelles en direct, destiné aux assistants qui doivent suivre le rythme d'un interlocuteur plutôt que de lire un script préparé. Il s'agit du modèle versionné derrière l'alias grok-voice-latest. Utilisez cet identifiant exact lorsqu'un produit nécessite une version de modèle fixe pour ses réponses vocales.
Points forts
- Il s'agit de la version fixe et numérotée derrière l'alias de l'agent vocal de xAI, de sorte que le comportement reste lié à un seul modèle jusqu'à ce que vous en changiez.
- La détection d'activité vocale côté serveur gère la prise de parole, permettant au client de diffuser l'audio du microphone sans avoir besoin de sa propre logique de pause.
- Les instructions par réponse permettent à une session de modifier l'invite système pour une seule réplique, par exemple pour changer de ton lors de l'explication d'un remboursement.
- Les remplacements de prononciation corrigent la façon dont les noms et les termes de produits sont prononcés sans altérer la transcription.
Quand préférer un autre modèle
- Il s'agit d'un modèle conversationnel de synthèse vocale (speech-to-speech) ; la transcription par lots de fichiers et la narration de longs textes sont mieux prises en charge par les modèles vocaux dédiés.
- Le maintien d'une connexion ouverte pour l'audio en direct nécessite un client WebSocket ; un simple appel de requête-réponse ne suffira pas à le piloter.
Pour commencer
Créer une clé API
Générez une clé dans Console et utilisez-la avec tous les modèles de la plateforme.
Envoyez votre première requête
Copiez l'exemple pour votre langage et lancez-le.
AudioChat Completions APIPOST/v1/chat/completionscurl https://api.tokenlab.sh/v1/chat/completions \ -H "Content-Type: application/json" \ -H "Authorization: Bearer sk-xxx" \ -d '{ "model": "grok-voice-think-fast-2.0", "messages": [ {"role": "user", "content": "Hello!"} ] }'
Tarification
Le tarif officiel est la référence publique du créateur du modèle. Le tarif TokenLab est ce que vous payez pour ce modèle sur TokenLab.
Audio Duration
par seconde- Tarif Official
- $0.001333
- Official
- $0.001333
- Remise
- —
| Tarif Officialpar seconde | Officialpar seconde | Remise | |
|---|---|---|---|
| Audio Duration | $0.001333 | $0.001333 | — |
Utilisation et activité
Le taux de réussite est la part de requêtes abouties. La latence est la durée d'une réponse complète ; P95 signifie que 95 % des requêtes ont fini dans ce délai.
Utilisation et disponibilité
Dernières 24 heures- Requêtes
- Taux de succès
- Latence P95
- Total des jetons
Les données sont basées sur les requêtes agrégées des utilisateurs, à l'exclusion des vérifications de statut.
Cas d'usage
Remplacement de serveur vocal interactif
Remplacez les menus téléphoniques par un interlocuteur qui énonce simplement son problème, tandis que l'agent transfère l'appel ou le résout.
Partenaire de pratique linguistique
Tenez un dialogue oral dans une langue cible, en corrigeant les erreurs à voix haute et en ajustant la vitesse à la demande de l'apprenant.
Assistant de terrain mains libres
Permettez à un technicien de poser des questions sur un manuel par commande vocale et d'entendre les réponses tout en gardant les mains sur l'équipement.
Exemples de prompts
Vous êtes un agent de support calme pour un fournisseur d'accès Internet. Demandez le code postal du compte, puis guidez l'appelant dans le redémarrage du routeur.
Prononcez notre marque 'Zyntra' comme ZIN-tra, gardez un ton amical et n'interrompez jamais l'appelant au milieu d'une phrase.
Agissez comme un tuteur de portugais. Parlez lentement, répétez ma phrase corrigée et posez une question de suivi à chaque tour.
FAQ
Quelle est la différence entre grok-voice-think-fast-2.0 et grok-voice-latest ?
grok-voice-think-fast-2.0 est une version spécifique du modèle, tandis que grok-voice-latest est un alias qui pointe actuellement vers celle-ci. L'alias sera mis à jour vers les nouvelles versions ; le nom daté reste sur la version que vous avez testée.
Grok Voice Think Fast 2.0 est-il un modèle de synthèse vocale (text-to-speech) ?
Non. Il écoute et répond lors d'une session en direct, en recevant de l'audio et en produisant des réponses parlées. Pour transformer un texte préparé en audio, utilisez Grok Voice TTS ; pour transcrire des enregistrements, utilisez Grok Voice STT.
Comment décide-t-il que j'ai fini de parler ?
Les sessions peuvent activer la détection d'activité vocale côté serveur, qui détecte la fin du tour de parole de l'utilisateur et déclenche la réponse. Vous pouvez également gérer les tours vous-même si votre client dispose déjà d'une fonction push-to-talk.
Quelles voix peut-il utiliser ?
Une session peut choisir parmi les voix intégrées de xAI, avec 'eve' par défaut, ou une voix personnalisée clonée à partir d'un court enregistrement de référence. Les voix intégrées parlent toutes les langues prises en charge.
Combien coûte Grok Voice Think Fast 2.0 ?
Sur TokenLab, Grok Voice Think Fast 2.0 coûte $0.001333 par seconde. La table tarifaire ci-dessus en montre le détail complet. Les tarifs dépendent de l’unité de facturation, de la spécification et de l’usage. Comparez des conditions identiques dans la tarification détaillée du modèle ; un tarif seul ne détermine pas le coût total.
Quel endpoint Grok Voice Think Fast 2.0 doit-il utiliser ?
Utilisez https://api.tokenlab.sh/v1/chat/completions pour Grok Voice Think Fast 2.0. L'exemple de requête ci-dessous montre la structure de code correspondante.
Comparer Grok Voice Think Fast 2.0
Sources
Mis à jour le 2 oct. 2026