Alibaba: Paraformer Realtime v2
paraformer-realtime-v2- Precio
- Desde $0.000035
- Modalidades
- Audio
Sobre Paraformer Realtime v2
Paraformer Realtime v2 es el reconocedor de voz en streaming de propósito general de Alibaba, que devuelve texto mientras el audio aún está llegando. Está dirigido a subtítulos, entrada de voz e interfaces de reuniones donde la transcripción debe actualizarse a medida que las personas siguen hablando. A diferencia de la variante 8K, no está ligado al ancho de banda telefónico, y a diferencia de Fun-ASR Realtime, pertenece a la línea Paraformer más antigua.
Puntos fuertes
- Actualiza la transcripción continuamente, lo que se adapta a subtítulos en vivo y pantallas de reuniones.
- Funciona con audio general de banda ancha, como auriculares y micrófonos de sala, no solo líneas telefónicas.
- Admite palabras clave para nombres y términos que aparecen a menudo en sus sesiones.
- Proporciona marcas de tiempo con los resultados transmitidos para alinear los subtítulos.
Cuándo buscar otra opción
- El audio de calidad telefónica de 8 kHz se adapta mejor a Paraformer Realtime 8K v2.
- El streaming significa que no hay una segunda pasada sobre el audio; utilice un modelo de archivo cuando la precisión final sea lo más importante.
Primeros pasos
Crear clave API
Genera una clave en Console y úsala con cualquier modelo de la plataforma.
Envía tu primera solicitud
Copia el ejemplo para tu lenguaje y ejecútalo contra el endpoint.
Voz a textoWebSocketWS/v1/realtime// npm install ws import WebSocket from 'ws'; const socket = new WebSocket("wss://api.tokenlab.sh/v1/realtime?model=paraformer-realtime-v2", { headers: { Authorization: "Bearer sk-xxx" } }); socket.on('open', () => { // Send the input events supported by this model with socket.send(...). // https://tokenlab.sh/docs/en/api-reference/realtime/connect }); socket.on('message', (data) => console.log(data.toString())); socket.on('error', (error) => console.error(error)); socket.on('close', (code, reason) => console.log(code, reason.toString())); // Close the session when finished. process.on('SIGINT', () => socket.close());
Precios
El precio oficial es la línea base pública del creador del modelo. El precio de TokenLab es lo que pagas por este modelo en TokenLab.
Tiempo real / Voz a texto
por segundo- Precio Official
- $0.00003529
- Official
- $0.00003529
- Descuento
- —
| Precio Officialpor segundo | Officialpor segundo | Descuento | |
|---|---|---|---|
| Tiempo real / Voz a texto | $0.00003529 | $0.00003529 | — |
Uso y actividad
La tasa de éxito es la proporción de solicitudes completadas. La latencia es cuánto tarda una respuesta completa; P95 significa que el 95 % de las solicitudes terminaron dentro de ese tiempo.
Uso y disponibilidad
Últimas 24 horas- Solicitudes
- Tasa de éxito
- Latencia P95
- Total de tokens
Los datos se basan en solicitudes de usuario agregadas, excluyendo las comprobaciones de estado.
Abrir en Console
Abre Paraformer Realtime v2 en Console con un prompt listo para editar o enviar.
Ayúdame a probar paraformer-realtime-v2 con una solicitud de audio breve en /v1/realtime. Muestra el resultado y el coste.
Casos de uso
Subtítulos de reuniones
Muestre una transcripción en vivo durante una reunión de video para que los participantes puedan seguirla o captar palabras perdidas.
Dictado por voz
Convierta el dictado en texto en un editor o formulario a medida que el usuario habla.
Subtítulos de eventos en vivo
Añada subtítulos a una charla o transmisión, actualizando cada oración a medida que el orador termina.
Ejemplos de prompts
Transmita este audio de reunión en vivo y muestre subtítulos a medida que las personas hablan.
Dicte un ticket de soporte por voz y rellene el cuadro de texto mientras hablo.
Transmita una conferencia principal con palabras clave para el orador y los nombres de los productos.
FAQ
¿Es Paraformer Realtime v2 para llamadas telefónicas?
No principalmente. Para audio telefónico de 8 kHz, Alibaba ofrece Paraformer Realtime 8K v2. Este modelo está dirigido a audio general en vivo proveniente de micrófonos, auriculares y software de reuniones.
¿Cómo se compara con Fun-ASR Realtime?
Ambos transmiten en streaming. Fun-ASR Realtime es la línea Fun-ASR más nueva con soporte de dialectos listado, mientras que Paraformer Realtime v2 es la opción establecida de Paraformer. Pruebe ambos con su audio y quédese con el que mejor se ajuste.
¿Cuál es el método de integración?
Una sesión WebSocket a través del SDK DashScope o el protocolo sin procesar. Su cliente envía audio en fragmentos y los eventos de reconocimiento regresan continuamente mientras la sesión permanece abierta.
¿Puede transcribir un archivo terminado?
Está diseñado para flujos de datos (streams). Para grabaciones terminadas, utilice Paraformer v2, la contraparte basada en archivos, que procesa todo el archivo y devuelve marcas de tiempo con cada resultado.
¿Cuánto cuesta Paraformer Realtime v2?
En TokenLab, Paraformer Realtime v2 cuesta $0.00003529 por segundo. La tabla de precios arriba muestra el desglose completo. Las tarifas dependen de la unidad de facturación, la especificación y el uso. Compare condiciones iguales en el precio detallado del modelo; una sola tarifa no determina el coste total.
¿Qué endpoint debe usar Paraformer Realtime v2?
Utiliza https://api.tokenlab.sh/v1/realtime para Paraformer Realtime v2. El ejemplo de solicitud a continuación muestra la estructura de código correspondiente.
¿Qué operaciones soporta Paraformer Realtime v2?
Paraformer Realtime v2 admite Voz a texto. Selecciona una operación arriba para ver su endpoint y ejemplo de solicitud.
Comparar Paraformer Realtime v2
Fuentes
- Model Studio: real-time speech recognition
- Model Studio: speech-to-text models for real-time and file transcription
Revisado el 2 oct 2026