Alibaba: Fun-ASR Realtime
fun-asr-realtime- 价格
- 起 $0.00009
- 模态
- 音频
Fun-ASR Realtime 简介
Fun-ASR Realtime 是阿里巴巴的流式语音识别模型:通过实时会话接收音频,边说边返回文字。它是 Fun-ASR 面向字幕、语音输入和通话辅助的变体,这类场景里用录音版 Fun-ASR 会让用户一直等到录音结束。阿里列出了热词、时间戳,以及普通话和粤语、四川话等方言的支持。
擅长的任务
- 说话人还在讲的时候就流式返回部分文字,字幕无需等录音结束。
- 据阿里文档,能高准确率识别普通话,也支持粤语、四川话等多种方言。
- 自定义热词能让实时识别更偏向你产品特有的名称和术语。
- 逐词和逐句的时间戳随流一起到达,便于对齐字幕。
什么情况换别的模型
- 它需要 WebSocket 会话,集成工作比把录音上传给 Fun-ASR 多。
- 实时解码无法回头重看之前的音频,需要归档级准确率时,录音版 Fun-ASR 更稳妥。
快速上手
创建 API 密钥
在 Console 生成一把密钥,平台上的模型都能用。
发送第一个请求
复制你所用语言的示例代码,向该端点发起请求。
语音转文字WebSocketWS/v1/realtime// npm install ws import WebSocket from 'ws'; const socket = new WebSocket("wss://api.tokenlab.sh/v1/realtime?model=fun-asr-realtime", { headers: { Authorization: "Bearer sk-xxx" } }); socket.on('open', () => { // Send the input events supported by this model with socket.send(...). // https://tokenlab.sh/docs/en/api-reference/realtime/connect }); socket.on('message', (data) => console.log(data.toString())); socket.on('error', (error) => console.error(error)); socket.on('close', (code, reason) => console.log(code, reason.toString())); // Close the session when finished. process.on('SIGINT', () => socket.close());
价格
官方价格是模型厂商公开的基线价,TokenLab 价格是用这个模型时实际的计费价。
实时 / 语音转文字
每秒- 官方价格
- $0.00009
- Official
- $0.00009
- 折扣
- —
| 官方价格每秒 | Official每秒 | 折扣 | |
|---|---|---|---|
| 实时 / 语音转文字 | $0.00009 | $0.00009 | — |
用量与动态
成功率是请求完成的比例;延迟是拿到一次完整响应要花的时间,P95 表示 95% 的请求都在这个时间内完成。
用量与可用性
最近 24 小时- 请求
- 成功率
- P95 延迟
- 总 token 数
数据来自汇总的用户请求,不含状态检查。
直接在 Console 里试
Fun-ASR Realtime 已在 Console 备好,提示词已填好,可以直接修改或发送。
帮我用 fun-asr-realtime 发起一条简短的音频请求,接口是 /v1/realtime。返回结果和费用。
使用场景
实时字幕
网络研讨会或活动现场,边讲边显示字幕,每句话稳定后更新。
语音输入
让用户对着表单或聊天框口述,边说边看到文字出现。
支持方言的助手
在等不起完整录音的应用里,处理普通话和地方方言的语音请求。
提示词示例
流式传输一场普通话产品发布会的麦克风音频,每句话结束时输出字幕。
转写一通实时的粤语客户来电,热词设为“退款”和“订单号”。
流式转写一场培训,并保留逐词时间戳,方便之后剪辑。
FAQ
什么时候选 Fun-ASR Realtime,而不是 Fun-ASR?
文字必须在说话的同时出现时选 Realtime,比如字幕或听写。已经有录制完成的音频,需要说话人分离或归档级准确率时,选录音版 Fun-ASR。
怎么把音频发给它?
通过流式 WebSocket 会话,可以用阿里的 DashScope SDK,也可以直接用原始协议。你推送音频分片,会话期间持续收到识别出的文本事件。
支持方言吗?
支持。阿里的实时识别文档列出了普通话,以及粤语、四川话等方言,另外还有可帮助识别名称和产品术语的自定义热词。方言语音和标准普通话在同一个实时会话里识别。
能处理句子之间的静音吗?
能。它带有语音活动检测,会过滤非语音音频并判断句子在哪里结束。静音阈值可在会话设置里配置,可以调整字幕多快稳定下来。
Fun-ASR Realtime 的费用是多少?
在 TokenLab 上,Fun-ASR Realtime 的价格为 $0.00009 每秒。完整明细见上方价格表。 价格因计费单位、规格和用量而异。请在模型的详细定价中对比相同条件下的费率;单一费率不代表总价。
Fun-ASR Realtime 应该使用哪个端点?
Fun-ASR Realtime 使用 https://api.tokenlab.sh/v1/realtime。代码写法见下方的请求示例。
Fun-ASR Realtime 支持哪些操作?
Fun-ASR Realtime 支持 语音转文字。选了操作,上面会显示对应的端点和请求示例。
Fun-ASR Realtime 对比
资料来源
- Model Studio: real-time speech recognition
- Model Studio: speech-to-text models for real-time and file transcription
审阅于 2026年10月2日