Alibaba: Fun-ASR Flash 2026-06-15
fun-asr-flash-2026-06-15- Preço
- A partir de $0.000035
- Modalidades
- Áudio
Sobre o Fun-ASR Flash 2026-06-15
Fun-ASR Flash 2026-06-15 é uma versão datada do modelo de reconhecimento de fala Flash da Alibaba, disponibilizada pela Alibaba como Qwen-Audio-3.0-ASR-Flash. Ele transcreve arquivos de áudio curtos por meio de uma chamada HTTP síncrona e utiliza turnos de conversação anteriores como contexto para direcionar o reconhecimento. Fixar o ID datado mantém um pipeline em uma versão específica, ao contrário de um alias sem data que pode ser atualizado.
Pontos fortes
- Aceita turnos de conversação anteriores junto com o áudio, de modo que o vocabulário da discussão em curso direcione o reconhecimento.
- A Alibaba lista carimbos de data/hora (timestamps) em nível de palavra e limites de frase na mesma resposta síncrona.
- A data no ID fixa uma versão específica, o que mantém execuções repetidas comparáveis.
Quando usar outro modelo
- Os clipes são limitados a cerca de cinco minutos, portanto, gravações longas exigem o Fun-ASR assíncrono ou um modelo filetrans.
- Ele lida apenas com clipes finalizados; para legendas ao vivo ou ditado, o Fun-ASR Realtime é o modelo de streaming.
Primeiros passos
Criar chave de API
Crie uma chave no Console e use com qualquer modelo da plataforma.
Envie sua primeira requisição
Copie o exemplo para sua linguagem e execute-o no endpoint.
Fala para textoEndpoint do TokenLabPOST/v1/audio/transcriptionscurl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \ -H "Authorization: Bearer sk-xxx" \ -F file="@audio.mp3" \ -F operation="stt" \ -F response_format="json" \ -F model="fun-asr-flash-2026-06-15" \ -F language="en"
Preço
O preço oficial é a base pública do criador do modelo. O preço TokenLab é o que você paga por este modelo na TokenLab.
Fala para texto
por segundo- Preço oficial
- $0.000035
- Official
- $0.000035
- Desconto
- —
| Preço oficialpor segundo | Officialpor segundo | Desconto | |
|---|---|---|---|
| Fala para texto | $0.000035 | $0.000035 | — |
Uso e atividade
A taxa de sucesso é a proporção de requisições concluídas. A latência é quanto tempo uma resposta completa leva; P95 significa que 95% das requisições terminaram dentro desse tempo.
Uso e disponibilidade
Últimas 24 horas- Requisições
- Taxa de sucesso
- Latência P95
- Total de tokens
Os dados baseiam-se em solicitações agregadas de usuários, excluindo verificações de status.
Abrir no Console
Abra Fun-ASR Flash 2026-06-15 no Console com um prompt pronto para editar ou enviar.
Ajude-me a testar fun-asr-flash-2026-06-15 com uma solicitação de áudio em /v1/audio/transcriptions. Exiba o resultado e custo.
Casos de uso
Notas de voz
Transcreva notas e mensagens gravadas curtas em uma única solicitação, sem enfileirar um trabalho assíncrono.
Ditado médico
Forneça o diálogo anterior como contexto para que nomes de medicamentos e termos clínicos tenham mais probabilidade de serem reconhecidos.
Pipelines de teste fixos
Mantenha a versão constante ao comparar mudanças de sumarização downstream com as mesmas transcrições.
Exemplos de prompt
Transcreva esta gravação clínica de 3 minutos; contexto: o turno anterior discutiu a dosagem de metformina.
Transcreva esta nota de voz de engenheiro de campo sobre uma falha de CLP e retorne os carimbos de data/hora das palavras.
Transcreva este clipe curto de atendimento ao cliente, usando os turnos de chat anteriores como contexto.
FAQ
O que significa a data em fun-asr-flash-2026-06-15?
Ela identifica uma versão específica, 15 de junho de 2026. Chamar o ID datado mantém seu pipeline nessa versão. A Alibaba o apresenta sob o nome Qwen-Audio-3.0-ASR-Flash.
Qual a duração máxima de um clipe de áudio?
A Alibaba documenta um limite de cerca de cinco minutos por chamada, com arquivos de até 2 GB. Para gravações mais longas, use o Fun-ASR ou o Qwen3 ASR Flash Filetrans, ambos aceitam trabalhos de arquivo assíncronos.
Posso fornecer contexto sobre a conversa?
Sim. Ele usa um formato de mensagem estilo chat, então você pode passar turnos anteriores antes do áudio. O modelo os utiliza para favorecer o vocabulário que se ajusta ao tópico, o que ajuda com termos especializados.
Ele retorna carimbos de data/hora (timestamps)?
Sim. A Alibaba descreve carimbos de data/hora em nível de palavra e limites de frase na resposta, para que você possa alinhar o texto ao áudio para legendas, revisão ou pesquisa sem uma etapa de alinhamento separada.
Quanto custa o Fun-ASR Flash 2026-06-15?
No TokenLab, Fun-ASR Flash 2026-06-15 custa $0.000035 por segundo. A tabela de preços acima mostra o detalhamento completo. As tarifas dependem da unidade de cobrança, da especificação e do uso. Compare condições iguais no preço detalhado do modelo; uma única tarifa não determina o custo total.
Qual endpoint o Fun-ASR Flash 2026-06-15 deve usar?
Use https://api.tokenlab.sh/v1/audio/transcriptions para Fun-ASR Flash 2026-06-15. O exemplo de requisição abaixo mostra o formato de código correspondente.
Quais operações o Fun-ASR Flash 2026-06-15 suporta?
Fun-ASR Flash 2026-06-15 suporta Fala para texto. Selecione uma operação acima para ver seu endpoint e exemplo de requisição.
Comparar Fun-ASR Flash 2026-06-15
Fontes
- Model Studio: speech-to-text models for real-time and file transcription
- Model Studio: recording file recognition models
Revisado em 2 de out. de 2026