Elija Auto, TokenLab Verified o Official para cada solicitud, con los precios mostrados por adelantado.Ver las novedades

Alibaba: Fun-ASR Flash 2026-06-15

Fun-ASR Flash 2026-06-15 es una versión de reconocimiento de voz fechada para la transcripción de archivos de audio. Fijar esta versión es útil cuando un proceso de transcripción necesita una elección de modelo consistente a través de ejecuciones de procesamiento repetidas.
Comparar modelos
fun-asr-flash-2026-06-15
DisponibleAlibabaVoz a textoSíncrono
Precio
Desde $0.000035
Modalidades
Audio

Sobre Fun-ASR Flash 2026-06-15

Fun-ASR Flash 2026-06-15 es una versión fechada del modelo de reconocimiento de voz Flash de Alibaba, presentada por Alibaba como Qwen-Audio-3.0-ASR-Flash. Transcribe archivos de audio cortos mediante una llamada HTTP síncrona y utiliza turnos de conversación previos como contexto para sesgar el reconocimiento. Fijar el ID fechado mantiene una canalización en una versión específica, a diferencia de un alias sin fecha que podría actualizarse.

Puntos fuertes

  • Acepta turnos de conversación anteriores junto con el audio, de modo que el vocabulario de la discusión en curso guía el reconocimiento.
  • Alibaba incluye marcas de tiempo a nivel de palabra y límites de oración en la misma respuesta síncrona.
  • La fecha en el ID fija una versión específica, lo que permite que las ejecuciones repetidas sean comparables.

Cuándo buscar otra opción

  • Los clips están limitados a unos cinco minutos, por lo que las grabaciones largas requieren el modelo asíncrono Fun-ASR o un modelo filetrans.
  • Solo maneja clips terminados; para subtítulos en vivo o dictado, Fun-ASR Realtime es el modelo de transmisión (streaming).

Primeros pasos

  1. Crear clave API

    Genera una clave en Console y úsala con cualquier modelo de la plataforma.

  2. Envía tu primera solicitud

    Copia el ejemplo para tu lenguaje y ejecútalo contra el endpoint.

    Voz a textoEndpoint de TokenLab
    POST/v1/audio/transcriptions
    curl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \
      -H "Authorization: Bearer sk-xxx" \
      -F file="@audio.mp3" \
      -F operation="stt" \
      -F response_format="json" \
      -F model="fun-asr-flash-2026-06-15" \
      -F language="en"

Precios

El precio oficial es la línea base pública del creador del modelo. El precio de TokenLab es lo que pagas por este modelo en TokenLab.

Voz a texto

por segundo
Precio Official
$0.000035
Official
$0.000035
Descuento
—

Uso y actividad

La tasa de éxito es la proporción de solicitudes completadas. La latencia es cuánto tarda una respuesta completa; P95 significa que el 95 % de las solicitudes terminaron dentro de ese tiempo.

Uso y disponibilidad

Últimas 24 horas
Solicitudes
Tasa de éxito
Latencia P95
Total de tokens
Desempeño del modelo
Las métricas aparecerán una vez que se alcancen los umbrales de privacidad y volumen de datos.

Los datos se basan en solicitudes de usuario agregadas, excluyendo las comprobaciones de estado.

Abrir en Console

Abre Fun-ASR Flash 2026-06-15 en Console con un prompt listo para editar o enviar.

Ayúdame a probar fun-asr-flash-2026-06-15 con una solicitud de audio breve en /v1/audio/transcriptions. Muestra el resultado y el coste.

Casos de uso

  • Notas de voz

    Transcriba notas y mensajes grabados cortos en una sola solicitud, sin necesidad de poner en cola un trabajo asíncrono.

  • Dictado médico

    Proporcione el diálogo precedente como contexto para que los nombres de medicamentos y términos clínicos tengan más probabilidades de ser reconocidos.

  • Canalizaciones de prueba fijadas

    Mantenga la versión constante mientras compara cambios de resumen posteriores con las mismas transcripciones.

Ejemplos de prompts

Transcriba esta grabación clínica de 3 minutos; contexto: el turno anterior discutió la dosis de metformina.

Transcriba esta nota de voz de un ingeniero de campo sobre una falla de PLC y devuelva las marcas de tiempo de las palabras.

Transcriba este clip corto de una llamada de cliente, utilizando los turnos de chat anteriores como contexto.

FAQ

¿Qué significa la fecha en fun-asr-flash-2026-06-15?

Identifica una versión específica, el 15 de junio de 2026. Llamar al ID fechado mantiene su canalización en esa versión. Alibaba lo presenta bajo el nombre Qwen-Audio-3.0-ASR-Flash.

¿Qué tan largo puede ser un clip de audio?

Alibaba documenta un límite de unos cinco minutos por llamada, con archivos de hasta 2 GB. Para grabaciones más largas, utilice Fun-ASR o Qwen3 ASR Flash Filetrans, los cuales aceptan trabajos de archivos asíncronos.

¿Puedo darle contexto sobre la conversación?

Sí. Utiliza un formato de mensaje estilo chat, por lo que puede pasar turnos anteriores antes del audio. El modelo los utiliza para favorecer el vocabulario que se ajusta al tema, lo que ayuda con los términos especializados.

¿Devuelve marcas de tiempo?

Sí. Alibaba describe marcas de tiempo a nivel de palabra y límites de oración en la respuesta, por lo que puede alinear el texto con el audio para subtítulos, revisión o búsqueda sin un paso de alineación separado.

¿Cuánto cuesta Fun-ASR Flash 2026-06-15?

En TokenLab, Fun-ASR Flash 2026-06-15 cuesta $0.000035 por segundo. La tabla de precios arriba muestra el desglose completo. Las tarifas dependen de la unidad de facturación, la especificación y el uso. Compare condiciones iguales en el precio detallado del modelo; una sola tarifa no determina el coste total.

¿Qué endpoint debe usar Fun-ASR Flash 2026-06-15?

Utiliza https://api.tokenlab.sh/v1/audio/transcriptions para Fun-ASR Flash 2026-06-15. El ejemplo de solicitud a continuación muestra la estructura de código correspondiente.

¿Qué operaciones soporta Fun-ASR Flash 2026-06-15?

Fun-ASR Flash 2026-06-15 admite Voz a texto. Selecciona una operación arriba para ver su endpoint y ejemplo de solicitud.

Comparar Fun-ASR Flash 2026-06-15

Fuentes

Revisado el 2 oct 2026

Más de Fun-ASR

Modelos relacionados