Alibaba: Paraformer Realtime v2
paraformer-realtime-v2- Prix
- À partir de $0.000035
- Modalités
- Audio
À propos de Paraformer Realtime v2
Paraformer Realtime v2 est le système de reconnaissance vocale en flux continu polyvalent d'Alibaba, renvoyant du texte pendant que l'audio arrive encore. Il cible les sous-titres, la saisie vocale et les interfaces de réunion où la transcription doit se mettre à jour au fur et à mesure que les personnes parlent. Contrairement à la variante 8K, il n'est pas lié à la bande passante téléphonique, et contrairement à Fun-ASR Realtime, il appartient à l'ancienne gamme Paraformer.
Points forts
- Met à jour la transcription en continu, ce qui convient aux sous-titres en direct et aux écrans de réunion.
- Fonctionne sur l'audio large bande général tel que les casques et les microphones de salle, pas seulement sur les lignes téléphoniques.
- Prend en charge les mots-clés pour les noms et termes qui apparaissent souvent dans vos sessions.
- Fournit des horodatages avec les résultats diffusés pour aligner les sous-titres.
Quand préférer un autre modèle
- L'audio de qualité téléphonique à 8 kHz est mieux adapté à Paraformer Realtime 8K v2.
- La diffusion en continu signifie qu'il n'y a pas de seconde passe sur l'audio ; utilisez un modèle de fichier lorsque la précision finale est primordiale.
Pour commencer
Créer une clé API
Générez une clé dans Console et utilisez-la avec tous les modèles de la plateforme.
Envoyez votre première requête
Copiez l'exemple pour votre langage et lancez-le.
Audio vers texteWebSocketWS/v1/realtime// npm install ws import WebSocket from 'ws'; const socket = new WebSocket("wss://api.tokenlab.sh/v1/realtime?model=paraformer-realtime-v2", { headers: { Authorization: "Bearer sk-xxx" } }); socket.on('open', () => { // Send the input events supported by this model with socket.send(...). // https://tokenlab.sh/docs/en/api-reference/realtime/connect }); socket.on('message', (data) => console.log(data.toString())); socket.on('error', (error) => console.error(error)); socket.on('close', (code, reason) => console.log(code, reason.toString())); // Close the session when finished. process.on('SIGINT', () => socket.close());
Tarification
Le tarif officiel est la référence publique du créateur du modèle. Le tarif TokenLab est ce que vous payez pour ce modèle sur TokenLab.
Temps réel / Audio vers texte
par seconde- Tarif Official
- $0.00003529
- Official
- $0.00003529
- Remise
- —
| Tarif Officialpar seconde | Officialpar seconde | Remise | |
|---|---|---|---|
| Temps réel / Audio vers texte | $0.00003529 | $0.00003529 | — |
Utilisation et activité
Le taux de réussite est la part de requêtes abouties. La latence est la durée d'une réponse complète ; P95 signifie que 95 % des requêtes ont fini dans ce délai.
Utilisation et disponibilité
Dernières 24 heures- Requêtes
- Taux de succès
- Latence P95
- Total des jetons
Les données sont basées sur les requêtes agrégées des utilisateurs, à l'exclusion des vérifications de statut.
Ouvrir dans Console
Ouvrez Paraformer Realtime v2 dans Console avec un prompt prêt à modifier ou envoyer.
Aide-moi à tester paraformer-realtime-v2 avec une requête audio sur /v1/realtime. Affiche le résultat et le coût.
Cas d'usage
Sous-titres de réunion
Affichez une transcription en direct pendant une réunion vidéo afin que les participants puissent suivre ou rattraper les mots manqués.
Saisie vocale
Convertissez la dictée en texte dans un éditeur ou un formulaire au fur et à mesure que l'utilisateur parle.
Sous-titres d'événements en direct
Ajoutez des sous-titres à une conférence ou une émission, en mettant à jour chaque phrase dès que l'orateur a terminé.
Exemples de prompts
Diffusez cet audio de réunion en direct et affichez les sous-titres au fur et à mesure que les personnes parlent.
Dictez un ticket de support par la voix et remplissez la zone de texte pendant que je parle.
Diffusez une conférence principale avec des mots-clés pour l'orateur et les noms de produits.
FAQ
Paraformer Realtime v2 est-il destiné aux appels téléphoniques ?
Pas principalement. Pour l'audio téléphonique à 8 kHz, Alibaba propose Paraformer Realtime 8K v2. Ce modèle cible l'audio en direct général provenant de microphones, de casques et de logiciels de réunion.
Comment se compare-t-il à Fun-ASR Realtime ?
Tous deux diffusent en continu. Fun-ASR Realtime est la gamme Fun-ASR plus récente avec une prise en charge des dialectes répertoriée, tandis que Paraformer Realtime v2 est l'option Paraformer établie. Testez les deux sur votre audio et gardez celui qui convient.
Quelle est la méthode d'intégration ?
Une session WebSocket via le SDK DashScope ou le protocole brut. Votre client envoie l'audio par segments, et les événements de reconnaissance reviennent en continu tant que la session reste ouverte.
Peut-il transcrire un fichier terminé ?
Il est conçu pour les flux. Pour les enregistrements terminés, utilisez Paraformer v2, l'équivalent basé sur les fichiers, qui traite le fichier entier et renvoie des horodatages avec chaque résultat.
Combien coûte Paraformer Realtime v2 ?
Sur TokenLab, Paraformer Realtime v2 coûte $0.00003529 par seconde. La table tarifaire ci-dessus en montre le détail complet. Les tarifs dépendent de l’unité de facturation, de la spécification et de l’usage. Comparez des conditions identiques dans la tarification détaillée du modèle ; un tarif seul ne détermine pas le coût total.
Quel endpoint Paraformer Realtime v2 doit-il utiliser ?
Utilisez https://api.tokenlab.sh/v1/realtime pour Paraformer Realtime v2. L'exemple de requête ci-dessous montre la structure de code correspondante.
Quelles opérations Paraformer Realtime v2 prend-il en charge ?
Paraformer Realtime v2 prend en charge Audio vers texte. Sélectionnez une opération pour voir l'endpoint et un exemple.
Comparer Paraformer Realtime v2
Sources
- Model Studio: real-time speech recognition
- Model Studio: speech-to-text models for real-time and file transcription
Mis à jour le 2 oct. 2026