Alibaba: Fun-ASR Realtime
fun-asr-realtime- Prix
- À partir de $0.00009
- Modalités
- Audio
À propos de Fun-ASR Realtime
Fun-ASR Realtime est le modèle de reconnaissance vocale en streaming d'Alibaba : il reçoit l'audio via une session en direct et renvoie du texte au fur et à mesure que les personnes parlent. C'est la variante de Fun-ASR destinée aux sous-titres, à la saisie vocale et à l'assistance en cours d'appel, là où le Fun-ASR pour audio enregistré forcerait les utilisateurs à attendre la fin de l'enregistrement. Alibaba répertorie les mots-clés (hotwords), les horodatages et le mandarin avec des dialectes tels que le cantonais et le sichuanais.
Points forts
- Diffuse du texte partiel pendant que l'interlocuteur parle encore, afin que les sous-titres apparaissent sans attendre la fin de l'enregistrement.
- Reconnaît le mandarin avec une grande précision ainsi que plusieurs dialectes, dont le cantonais et le sichuanais, selon la documentation d'Alibaba.
- Des mots-clés personnalisés orientent la reconnaissance en direct vers les noms et termes spécifiques à votre produit.
- Les horodatages au niveau des mots et des phrases arrivent avec le flux, ce qui aide à aligner les sous-titres.
Quand préférer un autre modèle
- Il nécessite une session WebSocket, ce qui représente plus de travail d'intégration que le simple téléchargement d'un enregistrement vers Fun-ASR.
- Le décodage en direct ne peut pas revenir sur l'audio précédent ; pour une précision d'archivage, le Fun-ASR pour audio enregistré est le choix le plus sûr.
Pour commencer
Créer une clé API
Générez une clé dans Console et utilisez-la avec tous les modèles de la plateforme.
Envoyez votre première requête
Copiez l'exemple pour votre langage et lancez-le.
Audio vers texteWebSocketWS/v1/realtime// npm install ws import WebSocket from 'ws'; const socket = new WebSocket("wss://api.tokenlab.sh/v1/realtime?model=fun-asr-realtime", { headers: { Authorization: "Bearer sk-xxx" } }); socket.on('open', () => { // Send the input events supported by this model with socket.send(...). // https://tokenlab.sh/docs/en/api-reference/realtime/connect }); socket.on('message', (data) => console.log(data.toString())); socket.on('error', (error) => console.error(error)); socket.on('close', (code, reason) => console.log(code, reason.toString())); // Close the session when finished. process.on('SIGINT', () => socket.close());
Tarification
Le tarif officiel est la référence publique du créateur du modèle. Le tarif TokenLab est ce que vous payez pour ce modèle sur TokenLab.
Temps réel / Audio vers texte
par seconde- Tarif Official
- $0.00009
- Official
- $0.00009
- Remise
- —
| Tarif Officialpar seconde | Officialpar seconde | Remise | |
|---|---|---|---|
| Temps réel / Audio vers texte | $0.00009 | $0.00009 | — |
Utilisation et activité
Le taux de réussite est la part de requêtes abouties. La latence est la durée d'une réponse complète ; P95 signifie que 95 % des requêtes ont fini dans ce délai.
Utilisation et disponibilité
Dernières 24 heures- Requêtes
- Taux de succès
- Latence P95
- Total des jetons
Les données sont basées sur les requêtes agrégées des utilisateurs, à l'exclusion des vérifications de statut.
Ouvrir dans Console
Ouvrez Fun-ASR Realtime dans Console avec un prompt prêt à modifier ou envoyer.
Aide-moi à tester fun-asr-realtime avec une requête audio sur /v1/realtime. Affiche le résultat et le coût.
Cas d'usage
Sous-titres en direct
Affichez les sous-titres d'un webinaire ou d'un événement au fur et à mesure que l'intervenant parle, en mettant à jour chaque phrase dès qu'elle est stabilisée.
Saisie vocale
Permettez aux utilisateurs de dicter dans un formulaire ou une boîte de discussion et de voir leurs mots apparaître pendant qu'ils parlent.
Assistants sensibles aux dialectes
Gérez les demandes orales en mandarin et en dialectes régionaux dans une application qui ne peut pas attendre un enregistrement complet.
Exemples de prompts
Diffusez l'audio d'un microphone pour un lancement de produit en mandarin et imprimez les sous-titres à la fin de chaque phrase.
Transcrivez un appel client en direct en cantonais avec les mots-clés 'remboursement' et 'numéro de commande'.
Diffusez une session de formation et conservez les horodatages des mots pour un découpage ultérieur.
FAQ
Quand dois-je choisir Fun-ASR Realtime plutôt que Fun-ASR ?
Choisissez Realtime lorsque le texte doit apparaître pendant que l'audio est encore en cours de diffusion, comme pour les sous-titres ou la dictée. Choisissez le Fun-ASR pour audio enregistré lorsque vous disposez d'un enregistrement terminé et que vous souhaitez une diarisation ou une précision d'archivage.
Comment lui envoyer de l'audio ?
Via une session WebSocket en streaming, soit par le SDK DashScope d'Alibaba, soit par le protocole brut. Vous envoyez des segments audio et recevez des événements de texte reconnu au fur et à mesure que la session se poursuit.
Prend-il en charge les dialectes ?
Oui. La documentation en temps réel d'Alibaba répertorie le mandarin ainsi que le cantonais, le sichuanais et d'autres dialectes, en plus de mots-clés personnalisés qui aident pour les noms et les termes de produits. La parole dialectale est reconnue au cours de la même session en direct que le mandarin standard.
Peut-il gérer le silence entre les phrases ?
Oui, il inclut une détection d'activité vocale qui filtre l'audio non vocal et décide où les phrases se terminent. Les seuils de silence sont configurables dans les paramètres de session, ce qui vous permet de régler la rapidité avec laquelle les sous-titres se stabilisent.
Combien coûte Fun-ASR Realtime ?
Sur TokenLab, Fun-ASR Realtime coûte $0.00009 par seconde. La table tarifaire ci-dessus en montre le détail complet. Les tarifs dépendent de l’unité de facturation, de la spécification et de l’usage. Comparez des conditions identiques dans la tarification détaillée du modèle ; un tarif seul ne détermine pas le coût total.
Quel endpoint Fun-ASR Realtime doit-il utiliser ?
Utilisez https://api.tokenlab.sh/v1/realtime pour Fun-ASR Realtime. L'exemple de requête ci-dessous montre la structure de code correspondante.
Quelles opérations Fun-ASR Realtime prend-il en charge ?
Fun-ASR Realtime prend en charge Audio vers texte. Sélectionnez une opération pour voir l'endpoint et un exemple.
Comparer Fun-ASR Realtime
Sources
- Model Studio: real-time speech recognition
- Model Studio: speech-to-text models for real-time and file transcription
Mis à jour le 2 oct. 2026