Choisissez Auto, TokenLab Verified ou Official pour chaque demande, avec les prix affichés à l'avance.Voir les nouveautés

xAI: Grok Voice STT

Grok Voice STT convertit l'audio enregistré en texte. Les indices linguistiques et les contrôles d'horodatage le rendent utile pour les transcriptions qui alimenteront le sous-titrage, la recherche ou une étape ultérieure d'analyse de texte.
Comparer les modèles
grok-voice-stt
DisponiblexAITranscription (Speech to Text)Synchrone
Prix
À partir de $0.000028
Modalités
Audio

À propos de Grok Voice STT

Grok Voice STT est le modèle de conversion parole-à-texte de xAI, transformant l'audio enregistré ou diffusé en transcriptions textuelles. Il accepte les formats de fichiers audio courants, renvoie des horodatages au niveau du mot, peut séparer les locuteurs et les canaux, et formate les nombres et les devises selon la langue. Utilisez-le pour les sous-titres, les enregistrements de réunions consultables et les transcriptions d'appels alimentant une analyse textuelle ultérieure.

Points forts

  • Les horodatages au niveau du mot permettent de créer facilement des sous-titres, une recherche par moment précis et des fichiers de sous-titrage à partir de la transcription.
  • La diarisation des locuteurs et la transcription multicanal permettent de distinguer qui a dit quoi lors de réunions et d'enregistrements d'appels bilatéraux.
  • Les indices linguistiques et une liste de termes clés personnalisés orientent la reconnaissance vers les noms de produits et le jargon.
  • Le formatage du texte rend les nombres, les dates et les devises tels qu'ils sont écrits dans la langue parlée.

Quand préférer un autre modèle

  • Il produit uniquement des transcriptions ; résumer, traduire ou répondre à partir de l'audio nécessite un modèle de texte par la suite.
  • Les enregistrements très bruyants peuvent nécessiter un ajustement du seuil de détection vocale ou une entrée plus propre avant que la précision ne soit acceptable.

Pour commencer

  1. Créer une clé API

    Générez une clé dans Console et utilisez-la avec tous les modèles de la plateforme.

  2. Envoyez votre première requête

    Copiez l'exemple pour votre langage et lancez-le.

    Audio vers texteEndpoint TokenLab
    POST/v1/audio/transcriptions
    curl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \
      -H "Authorization: Bearer sk-xxx" \
      -F file="@audio.mp3" \
      -F operation="stt" \
      -F response_format="json" \
      -F model="grok-voice-stt" \
      -F language="en"

Tarification

Le tarif officiel est la référence publique du créateur du modèle. Le tarif TokenLab est ce que vous payez pour ce modèle sur TokenLab.

Tarification

par seconde
Official
$0.000028par seconde
Tarif Official
$0.000028par seconde

Utilisation et activité

Le taux de réussite est la part de requêtes abouties. La latence est la durée d'une réponse complète ; P95 signifie que 95 % des requêtes ont fini dans ce délai.

Utilisation et disponibilité

Dernières 24 heures
Requêtes
Taux de succès
Latence P95
Total des jetons
Performance du modèle
Les métriques s'affichent une fois les seuils de confidentialité et de volume de données atteints.

Les données sont basées sur les requêtes agrégées des utilisateurs, à l'exclusion des vérifications de statut.

Ouvrir dans Console

Ouvrez Grok Voice STT dans Console avec un prompt prêt à modifier ou envoyer.

Aide-moi à tester grok-voice-stt avec une requête audio sur /v1/audio/transcriptions. Affiche le résultat et le coût.

Cas d'usage

  • Transcriptions de réunions

    Transcrivez un appel enregistré avec les locuteurs étiquetés, puis transmettez le texte à un outil de résumé pour en extraire les points d'action.

  • Sous-titres pour vidéo

    Générez des sous-titres temporisés à partir de la piste audio d'une vidéo téléchargée en utilisant les minutages des mots.

  • Examen de la qualité des centres d'appels

    Transcrivez des enregistrements à deux canaux avec l'agent et le client sur des canaux séparés, puis recherchez les phrases de conformité.

Exemples de prompts

Transcrivez cet épisode de podcast de 45 minutes en anglais avec des horodatages de mots et les locuteurs étiquetés.

Transcrivez l'appel client joint, en utilisant les termes clés 'Zyntra', 'OmniPlan' et 'SLA' pour biaiser la reconnaissance.

Convertissez ce mémo vocal espagnol en texte et formatez les montants en tant que devise.

FAQ

Que fait Grok Voice STT ?

Il convertit l'audio en texte. Vous envoyez un fichier ou diffusez de l'audio, et il renvoie une transcription qui peut inclure des horodatages au niveau du mot, des étiquettes de locuteur et du texte par canal, selon les options que vous définissez.

Quels formats audio peut-il lire ?

xAI répertorie douze formats, dont MP3, WAV, FLAC et Opus, avec une limite de taille de fichier de 500 Mo. L'audio PCM brut, mu-law et A-law nécessite des paramètres d'encodage explicites.

Prend-il en charge la transcription en direct ?

Oui. Un point de terminaison WebSocket diffuse des résultats intermédiaires et utilise la détection de fin de tour Smart Turn pour distinguer les pauses naturelles de la fin d'une phrase, ce qui réduit les coupures prématurées.

Combien de langues couvre-t-il ?

xAI documente plus de 25 langues pour la transcription et le formatage spécifique à la langue. Transmettez un indice linguistique lorsque vous connaissez la langue, afin que la reconnaissance n'ait pas à deviner.

Peut-il distinguer les locuteurs ?

Oui, la diarisation étiquette les locuteurs au sein d'un enregistrement, et le mode multicanal gère jusqu'à huit canaux séparés, ce qui convient aux enregistrements d'appels avec une partie par canal.

Combien coûte Grok Voice STT ?

Sur TokenLab, Grok Voice STT coûte $0.000028 par seconde. La table tarifaire ci-dessus en montre le détail complet.

Quel endpoint Grok Voice STT doit-il utiliser ?

Utilisez https://api.tokenlab.sh/v1/audio/transcriptions pour Grok Voice STT. L'exemple de requête ci-dessous montre la structure de code correspondante.

Quelles opérations Grok Voice STT prend-il en charge ?

Grok Voice STT prend en charge Audio vers texte. Sélectionnez une opération pour voir l'endpoint et un exemple.

Comparer Grok Voice STT

Sources

Mis à jour le 2 oct. 2026

Plus de la série Grok Voice

Modèles associés