Alibaba: Paraformer v2
paraformer-v2- Precio
- Desde $0.000012
- Modalidades
- Audio
Sobre Paraformer v2
Paraformer v2 es el modelo de reconocimiento de voz basado en archivos de Alibaba para transcripciones offline de reuniones y conversaciones largas. Se invoca de forma asíncrona en grabaciones de hasta 2 GB y 12 horas. En comparación con Paraformer 8K v2, está destinado a audio de banda ancha general, y frente a los modelos en tiempo real, sacrifica la inmediatez por una transcripción completa con diarización y palabras clave (hotwords).
Puntos fuertes
- Gestiona grabaciones muy largas, de hasta 12 horas o 2 GB por archivo, según la documentación de Alibaba.
- Las marcas de tiempo (timestamps) siempre están incluidas, por lo que no se necesita ninguna opción adicional para obtenerlas.
- La diarización de hablantes separa a los participantes en reuniones y discusiones grupales.
- El filtrado de palabras sensibles puede enmascarar términos específicos en el texto de la transcripción.
Cuándo buscar otra opción
- Los resultados llegan una vez finalizado el trabajo; para subtítulos en vivo se necesita Paraformer Realtime v2.
- Para grabaciones telefónicas de 8 kHz, la variante 8K se ajusta mejor al audio.
Primeros pasos
Crear clave API
Genera una clave en Console y úsala con cualquier modelo de la plataforma.
Envía tu primera solicitud
Copia el ejemplo para tu lenguaje y ejecútalo contra el endpoint.
Voz a textoEndpoint de TokenLabPOST/v1/audio/transcriptionscurl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \ -H "Authorization: Bearer sk-xxx" \ -F file="@audio.mp3" \ -F operation="stt" \ -F response_format="json" \ -F model="paraformer-v2" \ -F language="en"
Precios
El precio oficial es la línea base pública del creador del modelo. El precio de TokenLab es lo que pagas por este modelo en TokenLab.
Voz a texto
por segundo- Precio Official
- $0.00001176
- Official
- $0.00001176
- Descuento
- —
| Precio Officialpor segundo | Officialpor segundo | Descuento | |
|---|---|---|---|
| Voz a texto | $0.00001176 | $0.00001176 | — |
Uso y actividad
La tasa de éxito es la proporción de solicitudes completadas. La latencia es cuánto tarda una respuesta completa; P95 significa que el 95 % de las solicitudes terminaron dentro de ese tiempo.
Uso y disponibilidad
Últimas 24 horas- Solicitudes
- Tasa de éxito
- Latencia P95
- Total de tokens
Los datos se basan en solicitudes de usuario agregadas, excluyendo las comprobaciones de estado.
Abrir en Console
Abre Paraformer v2 en Console con un prompt listo para editar o enviar.
Ayúdame a probar paraformer-v2 con una solicitud de audio breve en /v1/audio/transcriptions. Muestra el resultado y el coste.
Casos de uso
Archivos de reuniones
Procesa grabaciones de reuniones guardadas para convertirlas en texto buscable con etiquetas de hablante y marcas de tiempo.
Transcripciones de conferencias
Transcribe conferencias de varias horas de una sola vez, luego indexa o resume el texto para los estudiantes.
Preparación para la moderación de contenido
Enmascara palabras sensibles configuradas en las transcripciones antes de compartirlas con un equipo más amplio.
Ejemplos de prompts
Transcribe esta grabación de una reunión general de 3 horas con etiquetas de hablante y marcas de tiempo.
Transcribe el audio de este video de conferencia y enmascara las palabras sensibles listadas.
Transcribe estas grabaciones de reuniones semanales (stand-ups) usando palabras clave para los nombres de nuestros proyectos.
FAQ
¿Para qué es mejor Paraformer v2?
Transcripción offline de reuniones, entrevistas y conversaciones grabadas. Acepta formatos de audio y video convencionales a cualquier frecuencia de muestreo y devuelve el texto junto con marcas de tiempo.
¿Qué tamaño puede tener la entrada?
Alibaba documenta archivos de hasta 2 GB y 12 horas para sus modelos de archivos Paraformer. Divide cualquier archivo más largo en partes antes de enviarlo para su transcripción.
¿Puedo desactivar las marcas de tiempo?
No. Alibaba indica que las marcas de tiempo están permanentemente habilitadas para Paraformer, por lo que cada transcripción las incluye y no se requiere ninguna opción de solicitud para obtener las posiciones temporales.
¿Paraformer v2 o Fun-ASR?
Ambos transcriben archivos con diarización y palabras clave. Fun-ASR es la línea más reciente; Paraformer v2 es la establecida. Ejecuta una muestra de tu audio a través de cada uno y compara los errores que sean importantes para ti.
¿Cuánto cuesta Paraformer v2?
En TokenLab, Paraformer v2 cuesta $0.00001176 por segundo. La tabla de precios arriba muestra el desglose completo. Las tarifas dependen de la unidad de facturación, la especificación y el uso. Compare condiciones iguales en el precio detallado del modelo; una sola tarifa no determina el coste total.
¿Qué endpoint debe usar Paraformer v2?
Utiliza https://api.tokenlab.sh/v1/audio/transcriptions para Paraformer v2. El ejemplo de solicitud a continuación muestra la estructura de código correspondiente.
¿Qué operaciones soporta Paraformer v2?
Paraformer v2 admite Voz a texto. Selecciona una operación arriba para ver su endpoint y ejemplo de solicitud.
Comparar Paraformer v2
Fuentes
- Model Studio: recording file recognition models
- Model Studio: speech-to-text models for real-time and file transcription
Revisado el 2 oct 2026