xAI: Grok Voice STT
grok-voice-stt- Prix
- À partir de $0.000028
- Modalités
- Audio
À propos de Grok Voice STT
Grok Voice STT est le modèle de conversion parole-à-texte de xAI, transformant l'audio enregistré ou diffusé en transcriptions textuelles. Il accepte les formats de fichiers audio courants, renvoie des horodatages au niveau du mot, peut séparer les locuteurs et les canaux, et formate les nombres et les devises selon la langue. Utilisez-le pour les sous-titres, les enregistrements de réunions consultables et les transcriptions d'appels alimentant une analyse textuelle ultérieure.
Points forts
- Les horodatages au niveau du mot permettent de créer facilement des sous-titres, une recherche par moment précis et des fichiers de sous-titrage à partir de la transcription.
- La diarisation des locuteurs et la transcription multicanal permettent de distinguer qui a dit quoi lors de réunions et d'enregistrements d'appels bilatéraux.
- Les indices linguistiques et une liste de termes clés personnalisés orientent la reconnaissance vers les noms de produits et le jargon.
- Le formatage du texte rend les nombres, les dates et les devises tels qu'ils sont écrits dans la langue parlée.
Quand préférer un autre modèle
- Il produit uniquement des transcriptions ; résumer, traduire ou répondre à partir de l'audio nécessite un modèle de texte par la suite.
- Les enregistrements très bruyants peuvent nécessiter un ajustement du seuil de détection vocale ou une entrée plus propre avant que la précision ne soit acceptable.
Pour commencer
Créer une clé API
Générez une clé dans Console et utilisez-la avec tous les modèles de la plateforme.
Envoyez votre première requête
Copiez l'exemple pour votre langage et lancez-le.
Audio vers texteEndpoint TokenLabPOST/v1/audio/transcriptionscurl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \ -H "Authorization: Bearer sk-xxx" \ -F file="@audio.mp3" \ -F operation="stt" \ -F response_format="json" \ -F model="grok-voice-stt" \ -F language="en"
Tarification
Le tarif officiel est la référence publique du créateur du modèle. Le tarif TokenLab est ce que vous payez pour ce modèle sur TokenLab.
Tarification
par seconde- Official
- $0.000028par seconde
- Tarif Official
- $0.000028par seconde
| Tarif Officialpar seconde | Officialpar seconde | Remise | |
|---|---|---|---|
| Prix | $0.000028par seconde | $0.000028par seconde | — |
Utilisation et activité
Le taux de réussite est la part de requêtes abouties. La latence est la durée d'une réponse complète ; P95 signifie que 95 % des requêtes ont fini dans ce délai.
Utilisation et disponibilité
Dernières 24 heures- Requêtes
- Taux de succès
- Latence P95
- Total des jetons
Les données sont basées sur les requêtes agrégées des utilisateurs, à l'exclusion des vérifications de statut.
Ouvrir dans Console
Ouvrez Grok Voice STT dans Console avec un prompt prêt à modifier ou envoyer.
Aide-moi à tester grok-voice-stt avec une requête audio sur /v1/audio/transcriptions. Affiche le résultat et le coût.
Cas d'usage
Transcriptions de réunions
Transcrivez un appel enregistré avec les locuteurs étiquetés, puis transmettez le texte à un outil de résumé pour en extraire les points d'action.
Sous-titres pour vidéo
Générez des sous-titres temporisés à partir de la piste audio d'une vidéo téléchargée en utilisant les minutages des mots.
Examen de la qualité des centres d'appels
Transcrivez des enregistrements à deux canaux avec l'agent et le client sur des canaux séparés, puis recherchez les phrases de conformité.
Exemples de prompts
Transcrivez cet épisode de podcast de 45 minutes en anglais avec des horodatages de mots et les locuteurs étiquetés.
Transcrivez l'appel client joint, en utilisant les termes clés 'Zyntra', 'OmniPlan' et 'SLA' pour biaiser la reconnaissance.
Convertissez ce mémo vocal espagnol en texte et formatez les montants en tant que devise.
FAQ
Que fait Grok Voice STT ?
Il convertit l'audio en texte. Vous envoyez un fichier ou diffusez de l'audio, et il renvoie une transcription qui peut inclure des horodatages au niveau du mot, des étiquettes de locuteur et du texte par canal, selon les options que vous définissez.
Quels formats audio peut-il lire ?
xAI répertorie douze formats, dont MP3, WAV, FLAC et Opus, avec une limite de taille de fichier de 500 Mo. L'audio PCM brut, mu-law et A-law nécessite des paramètres d'encodage explicites.
Prend-il en charge la transcription en direct ?
Oui. Un point de terminaison WebSocket diffuse des résultats intermédiaires et utilise la détection de fin de tour Smart Turn pour distinguer les pauses naturelles de la fin d'une phrase, ce qui réduit les coupures prématurées.
Combien de langues couvre-t-il ?
xAI documente plus de 25 langues pour la transcription et le formatage spécifique à la langue. Transmettez un indice linguistique lorsque vous connaissez la langue, afin que la reconnaissance n'ait pas à deviner.
Peut-il distinguer les locuteurs ?
Oui, la diarisation étiquette les locuteurs au sein d'un enregistrement, et le mode multicanal gère jusqu'à huit canaux séparés, ce qui convient aux enregistrements d'appels avec une partie par canal.
Combien coûte Grok Voice STT ?
Sur TokenLab, Grok Voice STT coûte $0.000028 par seconde. La table tarifaire ci-dessus en montre le détail complet.
Quel endpoint Grok Voice STT doit-il utiliser ?
Utilisez https://api.tokenlab.sh/v1/audio/transcriptions pour Grok Voice STT. L'exemple de requête ci-dessous montre la structure de code correspondante.
Quelles opérations Grok Voice STT prend-il en charge ?
Grok Voice STT prend en charge Audio vers texte. Sélectionnez une opération pour voir l'endpoint et un exemple.
Comparer Grok Voice STT
Sources
Mis à jour le 2 oct. 2026