Alibaba: Paraformer v2
paraformer-v2- Prix
- À partir de $0.000012
- Modalités
- Audio
À propos de Paraformer v2
Paraformer v2 est le modèle de reconnaissance vocale basé sur fichier d'Alibaba pour les transcriptions hors ligne de réunions et de longues conversations. Il est appelé de manière asynchrone sur des enregistrements allant jusqu'à 2 Go et 12 heures. Comparé à Paraformer 8K v2, il est destiné à l'audio large bande général, et par rapport aux modèles en temps réel, il sacrifie l'immédiateté pour une transcription complète avec diarisation et mots-clés.
Points forts
- Gère les enregistrements très longs, jusqu'à 12 heures ou 2 Go par fichier selon la documentation d'Alibaba.
- Les horodatages sont toujours inclus, aucune option supplémentaire n'est donc nécessaire pour les obtenir.
- La diarisation du locuteur sépare les participants lors des réunions et des discussions de groupe.
- Le filtrage des mots sensibles peut masquer les termes listés dans le texte de la transcription.
Quand préférer un autre modèle
- Les résultats arrivent une fois le travail terminé ; les sous-titres en direct nécessitent Paraformer Realtime v2.
- Pour les enregistrements téléphoniques à 8 kHz, la variante 8K correspond mieux à l'audio.
Pour commencer
Créer une clé API
Générez une clé dans Console et utilisez-la avec tous les modèles de la plateforme.
Envoyez votre première requête
Copiez l'exemple pour votre langage et lancez-le.
Audio vers texteEndpoint TokenLabPOST/v1/audio/transcriptionscurl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \ -H "Authorization: Bearer sk-xxx" \ -F file="@audio.mp3" \ -F operation="stt" \ -F response_format="json" \ -F model="paraformer-v2" \ -F language="en"
Tarification
Le tarif officiel est la référence publique du créateur du modèle. Le tarif TokenLab est ce que vous payez pour ce modèle sur TokenLab.
Audio vers texte
par seconde- Tarif Official
- $0.00001176
- Official
- $0.00001176
- Remise
- —
| Tarif Officialpar seconde | Officialpar seconde | Remise | |
|---|---|---|---|
| Audio vers texte | $0.00001176 | $0.00001176 | — |
Utilisation et activité
Le taux de réussite est la part de requêtes abouties. La latence est la durée d'une réponse complète ; P95 signifie que 95 % des requêtes ont fini dans ce délai.
Utilisation et disponibilité
Dernières 24 heures- Requêtes
- Taux de succès
- Latence P95
- Total des jetons
Les données sont basées sur les requêtes agrégées des utilisateurs, à l'exclusion des vérifications de statut.
Ouvrir dans Console
Ouvrez Paraformer v2 dans Console avec un prompt prêt à modifier ou envoyer.
Aide-moi à tester paraformer-v2 avec une requête audio sur /v1/audio/transcriptions. Affiche le résultat et le coût.
Cas d'usage
Archives de réunions
Transformez les enregistrements de réunions sauvegardés en texte consultable avec des étiquettes de locuteur et des horodatages.
Transcriptions de cours
Transcrivez des cours de plusieurs heures, puis indexez ou résumez le texte pour les étudiants.
Préparation à la modération de contenu
Masquez les mots sensibles configurés dans les transcriptions avant qu'elles ne soient partagées avec une équipe plus large.
Exemples de prompts
Transcrivez cet enregistrement de réunion générale de 3 heures avec des étiquettes de locuteur et des horodatages.
Transcrivez l'audio de cette vidéo de cours et masquez les mots sensibles listés.
Transcrivez ces enregistrements de réunions hebdomadaires en utilisant des mots-clés pour nos noms de projets.
FAQ
À quoi sert Paraformer v2 ?
Transcription hors ligne de réunions, d'entretiens et de conversations enregistrés. Il accepte les formats audio et vidéo courants à n'importe quel taux d'échantillonnage et renvoie le texte accompagné d'horodatages.
Quelle peut être la taille de l'entrée ?
Alibaba documente des fichiers allant jusqu'à 2 Go et 12 heures pour ses modèles de fichiers Paraformer. Divisez tout fichier plus long en plusieurs parties avant de le soumettre pour transcription.
Puis-je désactiver les horodatages ?
Non. Alibaba indique que les horodatages sont activés en permanence pour Paraformer, donc chaque transcription les contient et aucune option de requête n'est nécessaire pour obtenir les positions temporelles.
Paraformer v2 ou Fun-ASR ?
Les deux transcrivent des fichiers avec diarisation et mots-clés. Fun-ASR est la gamme plus récente ; Paraformer v2 est la gamme établie. Testez un échantillon de votre audio avec chacun et comparez les erreurs qui vous importent.
Combien coûte Paraformer v2 ?
Sur TokenLab, Paraformer v2 coûte $0.00001176 par seconde. La table tarifaire ci-dessus en montre le détail complet. Les tarifs dépendent de l’unité de facturation, de la spécification et de l’usage. Comparez des conditions identiques dans la tarification détaillée du modèle ; un tarif seul ne détermine pas le coût total.
Quel endpoint Paraformer v2 doit-il utiliser ?
Utilisez https://api.tokenlab.sh/v1/audio/transcriptions pour Paraformer v2. L'exemple de requête ci-dessous montre la structure de code correspondante.
Quelles opérations Paraformer v2 prend-il en charge ?
Paraformer v2 prend en charge Audio vers texte. Sélectionnez une opération pour voir l'endpoint et un exemple.
Comparer Paraformer v2
Sources
- Model Studio: recording file recognition models
- Model Studio: speech-to-text models for real-time and file transcription
Mis à jour le 2 oct. 2026