Alibaba: Fun-ASR Flash 2026-06-15
fun-asr-flash-2026-06-15- Prix
- À partir de $0.000035
- Modalités
- Audio
À propos de Fun-ASR Flash 2026-06-15
Fun-ASR Flash 2026-06-15 est une version datée du modèle de reconnaissance vocale Flash d'Alibaba, présentée par Alibaba sous le nom de Qwen-Audio-3.0-ASR-Flash. Il transcrit de courts fichiers audio via un appel HTTP synchrone et utilise les tours de parole précédents comme contexte pour orienter la reconnaissance. L'utilisation de l'identifiant daté permet de maintenir un pipeline sur une version spécifique, contrairement à un alias non daté qui peut être mis à jour.
Points forts
- Accepte les tours de parole précédents en plus de l'audio, afin que le vocabulaire de la discussion en cours oriente la reconnaissance.
- Alibaba indique des horodatages au niveau des mots et des limites de phrases dans la même réponse synchrone.
- La date dans l'identifiant fixe une version précise, ce qui permet de comparer des exécutions répétées.
Quand préférer un autre modèle
- Les clips sont limités à environ cinq minutes ; les enregistrements longs nécessitent donc le modèle Fun-ASR asynchrone ou un modèle filetrans.
- Il ne traite que les clips terminés ; pour les sous-titres en direct ou la dictée, Fun-ASR Realtime est le modèle de streaming.
Pour commencer
Créer une clé API
Générez une clé dans Console et utilisez-la avec tous les modèles de la plateforme.
Envoyez votre première requête
Copiez l'exemple pour votre langage et lancez-le.
Audio vers texteEndpoint TokenLabPOST/v1/audio/transcriptionscurl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \ -H "Authorization: Bearer sk-xxx" \ -F file="@audio.mp3" \ -F operation="stt" \ -F response_format="json" \ -F model="fun-asr-flash-2026-06-15" \ -F language="en"
Tarification
Le tarif officiel est la référence publique du créateur du modèle. Le tarif TokenLab est ce que vous payez pour ce modèle sur TokenLab.
Audio vers texte
par seconde- Tarif Official
- $0.000035
- Official
- $0.000035
- Remise
- —
| Tarif Officialpar seconde | Officialpar seconde | Remise | |
|---|---|---|---|
| Audio vers texte | $0.000035 | $0.000035 | — |
Utilisation et activité
Le taux de réussite est la part de requêtes abouties. La latence est la durée d'une réponse complète ; P95 signifie que 95 % des requêtes ont fini dans ce délai.
Utilisation et disponibilité
Dernières 24 heures- Requêtes
- Taux de succès
- Latence P95
- Total des jetons
Les données sont basées sur les requêtes agrégées des utilisateurs, à l'exclusion des vérifications de statut.
Ouvrir dans Console
Ouvrez Fun-ASR Flash 2026-06-15 dans Console avec un prompt prêt à modifier ou envoyer.
Aide-moi à tester fun-asr-flash-2026-06-15 avec une requête audio sur /v1/audio/transcriptions. Affiche le résultat et le coût.
Cas d'usage
Notes vocales
Transcrivez de courtes notes et messages enregistrés en une seule requête, sans avoir à mettre en file d'attente un travail asynchrone.
Dictée médicale
Transmettez le dialogue précédent comme contexte afin que les noms de médicaments et les termes cliniques soient plus facilement reconnus.
Pipelines de test figés
Maintenez la version constante tout en comparant les changements de résumé en aval par rapport aux mêmes transcriptions.
Exemples de prompts
Transcrivez cet enregistrement clinique de 3 minutes ; contexte : le tour de parole précédent traitait du dosage de la metformine.
Transcrivez cette note vocale d'ingénieur de terrain concernant une panne d'automate (PLC) et renvoyez les horodatages des mots.
Transcrivez ce court clip d'appel client en utilisant les tours de parole précédents comme contexte.
FAQ
Que signifie la date dans fun-asr-flash-2026-06-15 ?
Elle identifie une version spécifique, celle du 15 juin 2026. Appeler l'identifiant daté permet de maintenir votre pipeline sur cette version. Alibaba le présente sous le nom de Qwen-Audio-3.0-ASR-Flash.
Quelle peut être la durée d'un clip audio ?
Alibaba documente une limite d'environ cinq minutes par appel, avec des fichiers allant jusqu'à 2 Go. Pour des enregistrements plus longs, utilisez Fun-ASR ou Qwen3 ASR Flash Filetrans, qui prennent tous deux en charge les travaux de fichiers asynchrones.
Puis-je lui donner du contexte sur la conversation ?
Oui. Il utilise un format de message de type chat, vous pouvez donc transmettre les tours de parole précédents avant l'audio. Le modèle les utilise pour favoriser le vocabulaire adapté au sujet, ce qui aide pour les termes spécialisés.
Renvoie-t-il des horodatages ?
Oui. Alibaba décrit des horodatages au niveau des mots et des limites de phrases dans la réponse, ce qui vous permet d'aligner le texte sur l'audio pour les sous-titres, la révision ou la recherche sans étape d'alignement distincte.
Combien coûte Fun-ASR Flash 2026-06-15 ?
Sur TokenLab, Fun-ASR Flash 2026-06-15 coûte $0.000035 par seconde. La table tarifaire ci-dessus en montre le détail complet. Les tarifs dépendent de l’unité de facturation, de la spécification et de l’usage. Comparez des conditions identiques dans la tarification détaillée du modèle ; un tarif seul ne détermine pas le coût total.
Quel endpoint Fun-ASR Flash 2026-06-15 doit-il utiliser ?
Utilisez https://api.tokenlab.sh/v1/audio/transcriptions pour Fun-ASR Flash 2026-06-15. L'exemple de requête ci-dessous montre la structure de code correspondante.
Quelles opérations Fun-ASR Flash 2026-06-15 prend-il en charge ?
Fun-ASR Flash 2026-06-15 prend en charge Audio vers texte. Sélectionnez une opération pour voir l'endpoint et un exemple.
Comparer Fun-ASR Flash 2026-06-15
Sources
- Model Studio: speech-to-text models for real-time and file transcription
- Model Studio: recording file recognition models
Mis à jour le 2 oct. 2026