Escolha Auto, TokenLab Verified ou Official para cada solicitação, com preços exibidos antecipadamente.Veja as novidades

Alibaba: Fun-ASR Flash 2026-06-15

O Fun-ASR Flash 2026-06-15 é um lançamento de reconhecimento de fala datado para transcrição de arquivos de áudio. Fixar esta versão é útil quando um pipeline de transcrição precisa de uma escolha de modelo consistente em execuções de processamento repetidas.
Comparar modelos
fun-asr-flash-2026-06-15
DisponívelAlibabaFala para TextoSíncrono
Preço
A partir de $0.000035
Modalidades
Áudio

Sobre o Fun-ASR Flash 2026-06-15

Fun-ASR Flash 2026-06-15 é uma versão datada do modelo de reconhecimento de fala Flash da Alibaba, disponibilizada pela Alibaba como Qwen-Audio-3.0-ASR-Flash. Ele transcreve arquivos de áudio curtos por meio de uma chamada HTTP síncrona e utiliza turnos de conversação anteriores como contexto para direcionar o reconhecimento. Fixar o ID datado mantém um pipeline em uma versão específica, ao contrário de um alias sem data que pode ser atualizado.

Pontos fortes

  • Aceita turnos de conversação anteriores junto com o áudio, de modo que o vocabulário da discussão em curso direcione o reconhecimento.
  • A Alibaba lista carimbos de data/hora (timestamps) em nível de palavra e limites de frase na mesma resposta síncrona.
  • A data no ID fixa uma versão específica, o que mantém execuções repetidas comparáveis.

Quando usar outro modelo

  • Os clipes são limitados a cerca de cinco minutos, portanto, gravações longas exigem o Fun-ASR assíncrono ou um modelo filetrans.
  • Ele lida apenas com clipes finalizados; para legendas ao vivo ou ditado, o Fun-ASR Realtime é o modelo de streaming.

Primeiros passos

  1. Criar chave de API

    Crie uma chave no Console e use com qualquer modelo da plataforma.

  2. Envie sua primeira requisição

    Copie o exemplo para sua linguagem e execute-o no endpoint.

    Fala para textoEndpoint do TokenLab
    POST/v1/audio/transcriptions
    curl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \
      -H "Authorization: Bearer sk-xxx" \
      -F file="@audio.mp3" \
      -F operation="stt" \
      -F response_format="json" \
      -F model="fun-asr-flash-2026-06-15" \
      -F language="en"

Preço

O preço oficial é a base pública do criador do modelo. O preço TokenLab é o que você paga por este modelo na TokenLab.

Fala para texto

por segundo
Preço oficial
$0.000035
Official
$0.000035
Desconto
—

Uso e atividade

A taxa de sucesso é a proporção de requisições concluídas. A latência é quanto tempo uma resposta completa leva; P95 significa que 95% das requisições terminaram dentro desse tempo.

Uso e disponibilidade

Últimas 24 horas
Requisições
Taxa de sucesso
Latência P95
Total de tokens
Desempenho do modelo
As métricas aparecerão assim que os limites de privacidade e volume de dados forem atingidos.

Os dados baseiam-se em solicitações agregadas de usuários, excluindo verificações de status.

Abrir no Console

Abra Fun-ASR Flash 2026-06-15 no Console com um prompt pronto para editar ou enviar.

Ajude-me a testar fun-asr-flash-2026-06-15 com uma solicitação de áudio em /v1/audio/transcriptions. Exiba o resultado e custo.

Casos de uso

  • Notas de voz

    Transcreva notas e mensagens gravadas curtas em uma única solicitação, sem enfileirar um trabalho assíncrono.

  • Ditado médico

    Forneça o diálogo anterior como contexto para que nomes de medicamentos e termos clínicos tenham mais probabilidade de serem reconhecidos.

  • Pipelines de teste fixos

    Mantenha a versão constante ao comparar mudanças de sumarização downstream com as mesmas transcrições.

Exemplos de prompt

Transcreva esta gravação clínica de 3 minutos; contexto: o turno anterior discutiu a dosagem de metformina.

Transcreva esta nota de voz de engenheiro de campo sobre uma falha de CLP e retorne os carimbos de data/hora das palavras.

Transcreva este clipe curto de atendimento ao cliente, usando os turnos de chat anteriores como contexto.

FAQ

O que significa a data em fun-asr-flash-2026-06-15?

Ela identifica uma versão específica, 15 de junho de 2026. Chamar o ID datado mantém seu pipeline nessa versão. A Alibaba o apresenta sob o nome Qwen-Audio-3.0-ASR-Flash.

Qual a duração máxima de um clipe de áudio?

A Alibaba documenta um limite de cerca de cinco minutos por chamada, com arquivos de até 2 GB. Para gravações mais longas, use o Fun-ASR ou o Qwen3 ASR Flash Filetrans, ambos aceitam trabalhos de arquivo assíncronos.

Posso fornecer contexto sobre a conversa?

Sim. Ele usa um formato de mensagem estilo chat, então você pode passar turnos anteriores antes do áudio. O modelo os utiliza para favorecer o vocabulário que se ajusta ao tópico, o que ajuda com termos especializados.

Ele retorna carimbos de data/hora (timestamps)?

Sim. A Alibaba descreve carimbos de data/hora em nível de palavra e limites de frase na resposta, para que você possa alinhar o texto ao áudio para legendas, revisão ou pesquisa sem uma etapa de alinhamento separada.

Quanto custa o Fun-ASR Flash 2026-06-15?

No TokenLab, Fun-ASR Flash 2026-06-15 custa $0.000035 por segundo. A tabela de preços acima mostra o detalhamento completo. As tarifas dependem da unidade de cobrança, da especificação e do uso. Compare condições iguais no preço detalhado do modelo; uma única tarifa não determina o custo total.

Qual endpoint o Fun-ASR Flash 2026-06-15 deve usar?

Use https://api.tokenlab.sh/v1/audio/transcriptions para Fun-ASR Flash 2026-06-15. O exemplo de requisição abaixo mostra o formato de código correspondente.

Quais operações o Fun-ASR Flash 2026-06-15 suporta?

Fun-ASR Flash 2026-06-15 suporta Fala para texto. Selecione uma operação acima para ver seu endpoint e exemplo de requisição.

Comparar Fun-ASR Flash 2026-06-15

Fontes

Revisado em 2 de out. de 2026

Mais da série Fun-ASR

Modelos relacionados