Choisissez Auto, TokenLab Verified ou Official pour chaque demande, avec les prix affichés à l'avance.Voir les nouveautés

Alibaba: Paraformer Realtime v2

Paraformer Realtime v2 fournit une reconnaissance vocale en streaming pour l'audio en direct. Il convient aux sous-titres, aux entrées vocales et aux interfaces de réunion où la transcription doit se mettre à jour au fur et à mesure que les personnes parlent.
Comparer les modèles
paraformer-realtime-v2
DisponibleAlibabaTranscription (Speech to Text)Synchrone
Prix
À partir de $0.000035
Modalités
Audio

À propos de Paraformer Realtime v2

Paraformer Realtime v2 est le système de reconnaissance vocale en flux continu polyvalent d'Alibaba, renvoyant du texte pendant que l'audio arrive encore. Il cible les sous-titres, la saisie vocale et les interfaces de réunion où la transcription doit se mettre à jour au fur et à mesure que les personnes parlent. Contrairement à la variante 8K, il n'est pas lié à la bande passante téléphonique, et contrairement à Fun-ASR Realtime, il appartient à l'ancienne gamme Paraformer.

Points forts

  • Met à jour la transcription en continu, ce qui convient aux sous-titres en direct et aux écrans de réunion.
  • Fonctionne sur l'audio large bande général tel que les casques et les microphones de salle, pas seulement sur les lignes téléphoniques.
  • Prend en charge les mots-clés pour les noms et termes qui apparaissent souvent dans vos sessions.
  • Fournit des horodatages avec les résultats diffusés pour aligner les sous-titres.

Quand préférer un autre modèle

  • L'audio de qualité téléphonique à 8 kHz est mieux adapté à Paraformer Realtime 8K v2.
  • La diffusion en continu signifie qu'il n'y a pas de seconde passe sur l'audio ; utilisez un modèle de fichier lorsque la précision finale est primordiale.

Pour commencer

  1. Créer une clé API

    Générez une clé dans Console et utilisez-la avec tous les modèles de la plateforme.

  2. Envoyez votre première requête

    Copiez l'exemple pour votre langage et lancez-le.

    Audio vers texteWebSocket
    WS/v1/realtime
    // npm install ws
    import WebSocket from 'ws';
    
    const socket = new WebSocket("wss://api.tokenlab.sh/v1/realtime?model=paraformer-realtime-v2", {
      headers: { Authorization: "Bearer sk-xxx" }
    });
    
    socket.on('open', () => {
      // Send the input events supported by this model with socket.send(...).
      // https://tokenlab.sh/docs/en/api-reference/realtime/connect
    });
    socket.on('message', (data) => console.log(data.toString()));
    socket.on('error', (error) => console.error(error));
    socket.on('close', (code, reason) => console.log(code, reason.toString()));
    
    // Close the session when finished.
    process.on('SIGINT', () => socket.close());

Tarification

Le tarif officiel est la référence publique du créateur du modèle. Le tarif TokenLab est ce que vous payez pour ce modèle sur TokenLab.

Temps réel / Audio vers texte

par seconde
Tarif Official
$0.00003529
Official
$0.00003529
Remise
—

Utilisation et activité

Le taux de réussite est la part de requêtes abouties. La latence est la durée d'une réponse complète ; P95 signifie que 95 % des requêtes ont fini dans ce délai.

Utilisation et disponibilité

Dernières 24 heures
Requêtes
Taux de succès
Latence P95
Total des jetons
Performance du modèle
Les métriques s'affichent une fois les seuils de confidentialité et de volume de données atteints.

Les données sont basées sur les requêtes agrégées des utilisateurs, à l'exclusion des vérifications de statut.

Ouvrir dans Console

Ouvrez Paraformer Realtime v2 dans Console avec un prompt prêt à modifier ou envoyer.

Aide-moi à tester paraformer-realtime-v2 avec une requête audio sur /v1/realtime. Affiche le résultat et le coût.

Cas d'usage

  • Sous-titres de réunion

    Affichez une transcription en direct pendant une réunion vidéo afin que les participants puissent suivre ou rattraper les mots manqués.

  • Saisie vocale

    Convertissez la dictée en texte dans un éditeur ou un formulaire au fur et à mesure que l'utilisateur parle.

  • Sous-titres d'événements en direct

    Ajoutez des sous-titres à une conférence ou une émission, en mettant à jour chaque phrase dès que l'orateur a terminé.

Exemples de prompts

Diffusez cet audio de réunion en direct et affichez les sous-titres au fur et à mesure que les personnes parlent.

Dictez un ticket de support par la voix et remplissez la zone de texte pendant que je parle.

Diffusez une conférence principale avec des mots-clés pour l'orateur et les noms de produits.

FAQ

Paraformer Realtime v2 est-il destiné aux appels téléphoniques ?

Pas principalement. Pour l'audio téléphonique à 8 kHz, Alibaba propose Paraformer Realtime 8K v2. Ce modèle cible l'audio en direct général provenant de microphones, de casques et de logiciels de réunion.

Comment se compare-t-il à Fun-ASR Realtime ?

Tous deux diffusent en continu. Fun-ASR Realtime est la gamme Fun-ASR plus récente avec une prise en charge des dialectes répertoriée, tandis que Paraformer Realtime v2 est l'option Paraformer établie. Testez les deux sur votre audio et gardez celui qui convient.

Quelle est la méthode d'intégration ?

Une session WebSocket via le SDK DashScope ou le protocole brut. Votre client envoie l'audio par segments, et les événements de reconnaissance reviennent en continu tant que la session reste ouverte.

Peut-il transcrire un fichier terminé ?

Il est conçu pour les flux. Pour les enregistrements terminés, utilisez Paraformer v2, l'équivalent basé sur les fichiers, qui traite le fichier entier et renvoie des horodatages avec chaque résultat.

Combien coûte Paraformer Realtime v2 ?

Sur TokenLab, Paraformer Realtime v2 coûte $0.00003529 par seconde. La table tarifaire ci-dessus en montre le détail complet. Les tarifs dépendent de l’unité de facturation, de la spécification et de l’usage. Comparez des conditions identiques dans la tarification détaillée du modèle ; un tarif seul ne détermine pas le coût total.

Quel endpoint Paraformer Realtime v2 doit-il utiliser ?

Utilisez https://api.tokenlab.sh/v1/realtime pour Paraformer Realtime v2. L'exemple de requête ci-dessous montre la structure de code correspondante.

Quelles opérations Paraformer Realtime v2 prend-il en charge ?

Paraformer Realtime v2 prend en charge Audio vers texte. Sélectionnez une opération pour voir l'endpoint et un exemple.

Comparer Paraformer Realtime v2

Sources

Mis à jour le 2 oct. 2026

Plus de la série Paraformer

Modèles associés