Elija Auto, TokenLab Verified o Official para cada solicitud, con los precios mostrados por adelantado.Ver las novedades

Alibaba: Paraformer v2

Paraformer v2 transcribe audio grabado para procesamiento offline. Es útil para archivos de reuniones y grabaciones de conversaciones más largas que necesitan una transcripción escrita reutilizable después de que la sesión haya terminado.
Comparar modelos
paraformer-v2
DisponibleAlibabaVoz a textoSíncrono / Asíncrono
Precio
Desde $0.000012
Modalidades
Audio

Sobre Paraformer v2

Paraformer v2 es el modelo de reconocimiento de voz basado en archivos de Alibaba para transcripciones offline de reuniones y conversaciones largas. Se invoca de forma asíncrona en grabaciones de hasta 2 GB y 12 horas. En comparación con Paraformer 8K v2, está destinado a audio de banda ancha general, y frente a los modelos en tiempo real, sacrifica la inmediatez por una transcripción completa con diarización y palabras clave (hotwords).

Puntos fuertes

  • Gestiona grabaciones muy largas, de hasta 12 horas o 2 GB por archivo, según la documentación de Alibaba.
  • Las marcas de tiempo (timestamps) siempre están incluidas, por lo que no se necesita ninguna opción adicional para obtenerlas.
  • La diarización de hablantes separa a los participantes en reuniones y discusiones grupales.
  • El filtrado de palabras sensibles puede enmascarar términos específicos en el texto de la transcripción.

Cuándo buscar otra opción

  • Los resultados llegan una vez finalizado el trabajo; para subtítulos en vivo se necesita Paraformer Realtime v2.
  • Para grabaciones telefónicas de 8 kHz, la variante 8K se ajusta mejor al audio.

Primeros pasos

  1. Crear clave API

    Genera una clave en Console y úsala con cualquier modelo de la plataforma.

  2. Envía tu primera solicitud

    Copia el ejemplo para tu lenguaje y ejecútalo contra el endpoint.

    Voz a textoEndpoint de TokenLab
    POST/v1/audio/transcriptions
    curl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \
      -H "Authorization: Bearer sk-xxx" \
      -F file="@audio.mp3" \
      -F operation="stt" \
      -F response_format="json" \
      -F model="paraformer-v2" \
      -F language="en"

Precios

El precio oficial es la línea base pública del creador del modelo. El precio de TokenLab es lo que pagas por este modelo en TokenLab.

Voz a texto

por segundo
Precio Official
$0.00001176
Official
$0.00001176
Descuento
—

Uso y actividad

La tasa de éxito es la proporción de solicitudes completadas. La latencia es cuánto tarda una respuesta completa; P95 significa que el 95 % de las solicitudes terminaron dentro de ese tiempo.

Uso y disponibilidad

Últimas 24 horas
Solicitudes
Tasa de éxito
Latencia P95
Total de tokens
Desempeño del modelo
Las métricas aparecerán una vez que se alcancen los umbrales de privacidad y volumen de datos.

Los datos se basan en solicitudes de usuario agregadas, excluyendo las comprobaciones de estado.

Abrir en Console

Abre Paraformer v2 en Console con un prompt listo para editar o enviar.

Ayúdame a probar paraformer-v2 con una solicitud de audio breve en /v1/audio/transcriptions. Muestra el resultado y el coste.

Casos de uso

  • Archivos de reuniones

    Procesa grabaciones de reuniones guardadas para convertirlas en texto buscable con etiquetas de hablante y marcas de tiempo.

  • Transcripciones de conferencias

    Transcribe conferencias de varias horas de una sola vez, luego indexa o resume el texto para los estudiantes.

  • Preparación para la moderación de contenido

    Enmascara palabras sensibles configuradas en las transcripciones antes de compartirlas con un equipo más amplio.

Ejemplos de prompts

Transcribe esta grabación de una reunión general de 3 horas con etiquetas de hablante y marcas de tiempo.

Transcribe el audio de este video de conferencia y enmascara las palabras sensibles listadas.

Transcribe estas grabaciones de reuniones semanales (stand-ups) usando palabras clave para los nombres de nuestros proyectos.

FAQ

¿Para qué es mejor Paraformer v2?

Transcripción offline de reuniones, entrevistas y conversaciones grabadas. Acepta formatos de audio y video convencionales a cualquier frecuencia de muestreo y devuelve el texto junto con marcas de tiempo.

¿Qué tamaño puede tener la entrada?

Alibaba documenta archivos de hasta 2 GB y 12 horas para sus modelos de archivos Paraformer. Divide cualquier archivo más largo en partes antes de enviarlo para su transcripción.

¿Puedo desactivar las marcas de tiempo?

No. Alibaba indica que las marcas de tiempo están permanentemente habilitadas para Paraformer, por lo que cada transcripción las incluye y no se requiere ninguna opción de solicitud para obtener las posiciones temporales.

¿Paraformer v2 o Fun-ASR?

Ambos transcriben archivos con diarización y palabras clave. Fun-ASR es la línea más reciente; Paraformer v2 es la establecida. Ejecuta una muestra de tu audio a través de cada uno y compara los errores que sean importantes para ti.

¿Cuánto cuesta Paraformer v2?

En TokenLab, Paraformer v2 cuesta $0.00001176 por segundo. La tabla de precios arriba muestra el desglose completo. Las tarifas dependen de la unidad de facturación, la especificación y el uso. Compare condiciones iguales en el precio detallado del modelo; una sola tarifa no determina el coste total.

¿Qué endpoint debe usar Paraformer v2?

Utiliza https://api.tokenlab.sh/v1/audio/transcriptions para Paraformer v2. El ejemplo de solicitud a continuación muestra la estructura de código correspondiente.

¿Qué operaciones soporta Paraformer v2?

Paraformer v2 admite Voz a texto. Selecciona una operación arriba para ver su endpoint y ejemplo de solicitud.

Comparar Paraformer v2

Fuentes

Revisado el 2 oct 2026

Más de Paraformer

Modelos relacionados