Alibaba: Fun-ASR Realtime
fun-asr-realtime- Preço
- A partir de $0.00009
- Modalidades
- Áudio
Sobre o Fun-ASR Realtime
Fun-ASR Realtime é o modelo de reconhecimento de fala em streaming da Alibaba: ele recebe áudio durante uma sessão ao vivo e retorna texto conforme as pessoas falam. É a variante do Fun-ASR para legendas, entrada de voz e assistência em chamadas, onde o Fun-ASR de áudio gravado forçaria os usuários a esperar até que a gravação terminasse. A Alibaba lista palavras-chave (hotwords), carimbos de data/hora e mandarim com dialetos como cantonês e sichuanês.
Pontos fortes
- Transmite texto parcial enquanto o falante ainda está falando, para que as legendas apareçam sem esperar por uma gravação finalizada.
- Reconhece mandarim com alta precisão e vários dialetos, incluindo cantonês e sichuanês, de acordo com a documentação da Alibaba.
- Palavras-chave personalizadas (hotwords) direcionam o reconhecimento ao vivo para nomes e termos específicos do seu produto.
- Carimbos de data/hora em nível de palavra e frase chegam com o fluxo, o que ajuda a alinhar as legendas.
Quando usar outro modelo
- Ele requer uma sessão WebSocket, o que exige mais trabalho de integração do que fazer o upload de uma gravação para o Fun-ASR.
- A decodificação ao vivo não pode revisitar áudios anteriores, portanto, para precisão de arquivamento, o Fun-ASR de áudio gravado é a escolha mais segura.
Primeiros passos
Criar chave de API
Crie uma chave no Console e use com qualquer modelo da plataforma.
Envie sua primeira requisição
Copie o exemplo para sua linguagem e execute-o no endpoint.
Fala para textoWebSocketWS/v1/realtime// npm install ws import WebSocket from 'ws'; const socket = new WebSocket("wss://api.tokenlab.sh/v1/realtime?model=fun-asr-realtime", { headers: { Authorization: "Bearer sk-xxx" } }); socket.on('open', () => { // Send the input events supported by this model with socket.send(...). // https://tokenlab.sh/docs/en/api-reference/realtime/connect }); socket.on('message', (data) => console.log(data.toString())); socket.on('error', (error) => console.error(error)); socket.on('close', (code, reason) => console.log(code, reason.toString())); // Close the session when finished. process.on('SIGINT', () => socket.close());
Preço
O preço oficial é a base pública do criador do modelo. O preço TokenLab é o que você paga por este modelo na TokenLab.
Tempo real / Fala para texto
por segundo- Preço oficial
- $0.00009
- Official
- $0.00009
- Desconto
- —
| Preço oficialpor segundo | Officialpor segundo | Desconto | |
|---|---|---|---|
| Tempo real / Fala para texto | $0.00009 | $0.00009 | — |
Uso e atividade
A taxa de sucesso é a proporção de requisições concluídas. A latência é quanto tempo uma resposta completa leva; P95 significa que 95% das requisições terminaram dentro desse tempo.
Uso e disponibilidade
Últimas 24 horas- Requisições
- Taxa de sucesso
- Latência P95
- Total de tokens
Os dados baseiam-se em solicitações agregadas de usuários, excluindo verificações de status.
Abrir no Console
Abra Fun-ASR Realtime no Console com um prompt pronto para editar ou enviar.
Ajude-me a testar fun-asr-realtime com uma solicitação de áudio em /v1/realtime. Exiba o resultado e custo.
Casos de uso
Legendas ao vivo
Exiba legendas para um webinar ou evento conforme o falante fala, atualizando cada frase à medida que ela é concluída.
Entrada de voz
Permita que os usuários ditem em um formulário ou caixa de chat e vejam suas palavras aparecerem enquanto falam.
Assistentes com reconhecimento de dialeto
Lide com solicitações faladas em mandarim e dialetos regionais em um aplicativo que não pode esperar por uma gravação completa.
Exemplos de prompt
Transmita áudio de microfone para um lançamento de produto em mandarim e imprima legendas conforme cada frase termina.
Transcreva uma chamada de cliente em cantonês ao vivo com as palavras-chave 'reembolso' e 'número do pedido'.
Transmita uma sessão de treinamento e mantenha os carimbos de data/hora das palavras para recorte posterior.
FAQ
Quando devo escolher o Fun-ASR Realtime em vez do Fun-ASR?
Escolha o Realtime quando o texto precisar aparecer enquanto o áudio ainda está sendo falado, como em legendas ou ditado. Escolha o Fun-ASR de áudio gravado quando você tiver uma gravação finalizada e desejar diarização ou precisão de arquivamento.
Como envio áudio para ele?
Por meio de uma sessão WebSocket de streaming, seja pelo SDK DashScope da Alibaba ou pelo protocolo bruto. Você envia blocos de áudio e recebe eventos de texto reconhecido conforme a sessão continua.
Ele suporta dialetos?
Sim. A documentação em tempo real da Alibaba lista mandarim, além de cantonês, sichuanês e outros dialetos, juntamente com palavras-chave personalizadas que ajudam com nomes e termos de produtos. A fala em dialeto é reconhecida na mesma sessão ao vivo que o mandarim padrão.
Ele consegue lidar com silêncio entre as frases?
Sim, ele inclui detecção de atividade de voz que filtra áudio que não é fala e decide onde as frases terminam. Os limites de silêncio são configuráveis nas configurações da sessão, para que você possa ajustar a rapidez com que as legendas são finalizadas.
Quanto custa o Fun-ASR Realtime?
No TokenLab, Fun-ASR Realtime custa $0.00009 por segundo. A tabela de preços acima mostra o detalhamento completo. As tarifas dependem da unidade de cobrança, da especificação e do uso. Compare condições iguais no preço detalhado do modelo; uma única tarifa não determina o custo total.
Qual endpoint o Fun-ASR Realtime deve usar?
Use https://api.tokenlab.sh/v1/realtime para Fun-ASR Realtime. O exemplo de requisição abaixo mostra o formato de código correspondente.
Quais operações o Fun-ASR Realtime suporta?
Fun-ASR Realtime suporta Fala para texto. Selecione uma operação acima para ver seu endpoint e exemplo de requisição.
Comparar Fun-ASR Realtime
Fontes
- Model Studio: real-time speech recognition
- Model Studio: speech-to-text models for real-time and file transcription
Revisado em 2 de out. de 2026