Choisissez Auto, TokenLab Verified ou Official pour chaque demande, avec les prix affichés à l'avance.Voir les nouveautés

Alibaba: Paraformer v2

Paraformer v2 transcrit l'audio enregistré pour un traitement hors ligne. Il est utile pour les archives de réunions et les enregistrements de conversations plus longs qui nécessitent une transcription écrite réutilisable après la fin de la session.
Comparer les modèles
paraformer-v2
DisponibleAlibabaTranscription (Speech to Text)Synchrone / Asynchrone
Prix
À partir de $0.000012
Modalités
Audio

À propos de Paraformer v2

Paraformer v2 est le modèle de reconnaissance vocale basé sur fichier d'Alibaba pour les transcriptions hors ligne de réunions et de longues conversations. Il est appelé de manière asynchrone sur des enregistrements allant jusqu'à 2 Go et 12 heures. Comparé à Paraformer 8K v2, il est destiné à l'audio large bande général, et par rapport aux modèles en temps réel, il sacrifie l'immédiateté pour une transcription complète avec diarisation et mots-clés.

Points forts

  • Gère les enregistrements très longs, jusqu'à 12 heures ou 2 Go par fichier selon la documentation d'Alibaba.
  • Les horodatages sont toujours inclus, aucune option supplémentaire n'est donc nécessaire pour les obtenir.
  • La diarisation du locuteur sépare les participants lors des réunions et des discussions de groupe.
  • Le filtrage des mots sensibles peut masquer les termes listés dans le texte de la transcription.

Quand préférer un autre modèle

  • Les résultats arrivent une fois le travail terminé ; les sous-titres en direct nécessitent Paraformer Realtime v2.
  • Pour les enregistrements téléphoniques à 8 kHz, la variante 8K correspond mieux à l'audio.

Pour commencer

  1. Créer une clé API

    Générez une clé dans Console et utilisez-la avec tous les modèles de la plateforme.

  2. Envoyez votre première requête

    Copiez l'exemple pour votre langage et lancez-le.

    Audio vers texteEndpoint TokenLab
    POST/v1/audio/transcriptions
    curl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \
      -H "Authorization: Bearer sk-xxx" \
      -F file="@audio.mp3" \
      -F operation="stt" \
      -F response_format="json" \
      -F model="paraformer-v2" \
      -F language="en"

Tarification

Le tarif officiel est la référence publique du créateur du modèle. Le tarif TokenLab est ce que vous payez pour ce modèle sur TokenLab.

Audio vers texte

par seconde
Tarif Official
$0.00001176
Official
$0.00001176
Remise
—

Utilisation et activité

Le taux de réussite est la part de requêtes abouties. La latence est la durée d'une réponse complète ; P95 signifie que 95 % des requêtes ont fini dans ce délai.

Utilisation et disponibilité

Dernières 24 heures
Requêtes
Taux de succès
Latence P95
Total des jetons
Performance du modèle
Les métriques s'affichent une fois les seuils de confidentialité et de volume de données atteints.

Les données sont basées sur les requêtes agrégées des utilisateurs, à l'exclusion des vérifications de statut.

Ouvrir dans Console

Ouvrez Paraformer v2 dans Console avec un prompt prêt à modifier ou envoyer.

Aide-moi à tester paraformer-v2 avec une requête audio sur /v1/audio/transcriptions. Affiche le résultat et le coût.

Cas d'usage

  • Archives de réunions

    Transformez les enregistrements de réunions sauvegardés en texte consultable avec des étiquettes de locuteur et des horodatages.

  • Transcriptions de cours

    Transcrivez des cours de plusieurs heures, puis indexez ou résumez le texte pour les étudiants.

  • Préparation à la modération de contenu

    Masquez les mots sensibles configurés dans les transcriptions avant qu'elles ne soient partagées avec une équipe plus large.

Exemples de prompts

Transcrivez cet enregistrement de réunion générale de 3 heures avec des étiquettes de locuteur et des horodatages.

Transcrivez l'audio de cette vidéo de cours et masquez les mots sensibles listés.

Transcrivez ces enregistrements de réunions hebdomadaires en utilisant des mots-clés pour nos noms de projets.

FAQ

À quoi sert Paraformer v2 ?

Transcription hors ligne de réunions, d'entretiens et de conversations enregistrés. Il accepte les formats audio et vidéo courants à n'importe quel taux d'échantillonnage et renvoie le texte accompagné d'horodatages.

Quelle peut être la taille de l'entrée ?

Alibaba documente des fichiers allant jusqu'à 2 Go et 12 heures pour ses modèles de fichiers Paraformer. Divisez tout fichier plus long en plusieurs parties avant de le soumettre pour transcription.

Puis-je désactiver les horodatages ?

Non. Alibaba indique que les horodatages sont activés en permanence pour Paraformer, donc chaque transcription les contient et aucune option de requête n'est nécessaire pour obtenir les positions temporelles.

Paraformer v2 ou Fun-ASR ?

Les deux transcrivent des fichiers avec diarisation et mots-clés. Fun-ASR est la gamme plus récente ; Paraformer v2 est la gamme établie. Testez un échantillon de votre audio avec chacun et comparez les erreurs qui vous importent.

Combien coûte Paraformer v2 ?

Sur TokenLab, Paraformer v2 coûte $0.00001176 par seconde. La table tarifaire ci-dessus en montre le détail complet. Les tarifs dépendent de l’unité de facturation, de la spécification et de l’usage. Comparez des conditions identiques dans la tarification détaillée du modèle ; un tarif seul ne détermine pas le coût total.

Quel endpoint Paraformer v2 doit-il utiliser ?

Utilisez https://api.tokenlab.sh/v1/audio/transcriptions pour Paraformer v2. L'exemple de requête ci-dessous montre la structure de code correspondante.

Quelles opérations Paraformer v2 prend-il en charge ?

Paraformer v2 prend en charge Audio vers texte. Sélectionnez une opération pour voir l'endpoint et un exemple.

Comparer Paraformer v2

Sources

Mis à jour le 2 oct. 2026

Plus de la série Paraformer

Modèles associés