Elija Auto, TokenLab Verified o Official para cada solicitud, con los precios mostrados por adelantado.Ver las novedades

Alibaba: Fun-ASR Realtime

Fun-ASR Realtime consume audio entrante a medida que avanza una sesión. Está diseñado para experiencias de transcripción en vivo como subtítulos y entrada de voz, donde esperar a una grabación completa interrumpiría la interacción.
Comparar modelos
fun-asr-realtime
DisponibleAlibabaVoz a textoSíncrono
Precio
Desde $0.00009
Modalidades
Audio

Sobre Fun-ASR Realtime

Fun-ASR Realtime es el modelo de reconocimiento de voz en tiempo real de Alibaba: recibe audio a través de una sesión en vivo y devuelve texto a medida que las personas hablan. Es la variante de Fun-ASR para subtítulos, entrada de voz y asistencia durante llamadas, donde el Fun-ASR de audio grabado obligaría a los usuarios a esperar hasta que termine la grabación. Alibaba incluye palabras clave (hotwords), marcas de tiempo y mandarín con dialectos como el cantonés y el sichuanés.

Puntos fuertes

  • Transmite texto parcial mientras el hablante aún está hablando, por lo que los subtítulos aparecen sin esperar a que termine la grabación.
  • Reconoce mandarín con alta precisión y varios dialectos, incluidos el cantonés y el sichuanés, según la documentación de Alibaba.
  • Las palabras clave personalizadas (hotwords) dirigen el reconocimiento en vivo hacia nombres y términos específicos de su producto.
  • Las marcas de tiempo a nivel de palabra y oración llegan con la transmisión, lo que ayuda a alinear los subtítulos.

Cuándo buscar otra opción

  • Requiere una sesión WebSocket, lo cual implica más trabajo de integración que cargar una grabación en Fun-ASR.
  • La decodificación en vivo no puede volver a revisar audio anterior, por lo que para la precisión de archivo, el Fun-ASR de audio grabado es la opción más segura.

Primeros pasos

  1. Crear clave API

    Genera una clave en Console y úsala con cualquier modelo de la plataforma.

  2. Envía tu primera solicitud

    Copia el ejemplo para tu lenguaje y ejecútalo contra el endpoint.

    Voz a textoWebSocket
    WS/v1/realtime
    // npm install ws
    import WebSocket from 'ws';
    
    const socket = new WebSocket("wss://api.tokenlab.sh/v1/realtime?model=fun-asr-realtime", {
      headers: { Authorization: "Bearer sk-xxx" }
    });
    
    socket.on('open', () => {
      // Send the input events supported by this model with socket.send(...).
      // https://tokenlab.sh/docs/en/api-reference/realtime/connect
    });
    socket.on('message', (data) => console.log(data.toString()));
    socket.on('error', (error) => console.error(error));
    socket.on('close', (code, reason) => console.log(code, reason.toString()));
    
    // Close the session when finished.
    process.on('SIGINT', () => socket.close());

Precios

El precio oficial es la línea base pública del creador del modelo. El precio de TokenLab es lo que pagas por este modelo en TokenLab.

Tiempo real / Voz a texto

por segundo
Precio Official
$0.00009
Official
$0.00009
Descuento
—

Uso y actividad

La tasa de éxito es la proporción de solicitudes completadas. La latencia es cuánto tarda una respuesta completa; P95 significa que el 95 % de las solicitudes terminaron dentro de ese tiempo.

Uso y disponibilidad

Últimas 24 horas
Solicitudes
Tasa de éxito
Latencia P95
Total de tokens
Desempeño del modelo
Las métricas aparecerán una vez que se alcancen los umbrales de privacidad y volumen de datos.

Los datos se basan en solicitudes de usuario agregadas, excluyendo las comprobaciones de estado.

Abrir en Console

Abre Fun-ASR Realtime en Console con un prompt listo para editar o enviar.

Ayúdame a probar fun-asr-realtime con una solicitud de audio breve en /v1/realtime. Muestra el resultado y el coste.

Casos de uso

  • Subtítulos en vivo

    Muestre subtítulos para un seminario web o evento mientras el hablante habla, actualizando cada oración a medida que se completa.

  • Entrada de voz

    Permita que los usuarios dicten en un formulario o cuadro de chat y vean sus palabras aparecer mientras hablan.

  • Asistentes que reconocen dialectos

    Maneje solicitudes habladas en mandarín y dialectos regionales en una aplicación que no puede esperar a una grabación completa.

Ejemplos de prompts

Transmita audio de micrófono para un lanzamiento de producto en mandarín e imprima subtítulos a medida que termina cada oración.

Transcriba una llamada de cliente en cantonés en vivo con las palabras clave 'reembolso' y 'número de pedido'.

Transmita una sesión de capacitación y guarde las marcas de tiempo de las palabras para recortar más tarde.

FAQ

¿Cuándo debería elegir Fun-ASR Realtime en lugar de Fun-ASR?

Elija Realtime cuando el texto deba aparecer mientras el audio aún se está emitiendo, como en subtítulos o dictado. Elija el Fun-ASR de audio grabado cuando tenga una grabación terminada y desee diarización o precisión de archivo.

¿Cómo le envío audio?

A través de una sesión de transmisión WebSocket, ya sea mediante el SDK DashScope de Alibaba o el protocolo sin procesar. Usted envía fragmentos de audio y recibe eventos de texto reconocido a medida que continúa la sesión.

¿Admite dialectos?

Sí. La documentación en tiempo real de Alibaba enumera el mandarín además del cantonés, el sichuanés y otros dialectos, junto con palabras clave personalizadas que ayudan con nombres y términos de productos. El habla en dialecto se reconoce en la misma sesión en vivo que el mandarín estándar.

¿Puede manejar el silencio entre oraciones?

Sí, incluye detección de actividad de voz que filtra el audio que no es voz y decide dónde terminan las oraciones. Los umbrales de silencio son configurables en la configuración de la sesión, por lo que puede ajustar qué tan rápido se establecen los subtítulos.

¿Cuánto cuesta Fun-ASR Realtime?

En TokenLab, Fun-ASR Realtime cuesta $0.00009 por segundo. La tabla de precios arriba muestra el desglose completo. Las tarifas dependen de la unidad de facturación, la especificación y el uso. Compare condiciones iguales en el precio detallado del modelo; una sola tarifa no determina el coste total.

¿Qué endpoint debe usar Fun-ASR Realtime?

Utiliza https://api.tokenlab.sh/v1/realtime para Fun-ASR Realtime. El ejemplo de solicitud a continuación muestra la estructura de código correspondiente.

¿Qué operaciones soporta Fun-ASR Realtime?

Fun-ASR Realtime admite Voz a texto. Selecciona una operación arriba para ver su endpoint y ejemplo de solicitud.

Comparar Fun-ASR Realtime

Fuentes

Revisado el 2 oct 2026

Más de Fun-ASR

Modelos relacionados