每次请求可选择 Auto、TokenLab Verified 或 Official,并查看对应价格。查看更新

Alibaba: Fun-ASR Realtime

Fun-ASR Realtime 在会话进行中持续接收音频,适合实时字幕和语音输入,让转写融入交互过程,无需先等整段录音结束。
对比模型
fun-asr-realtime
可用Alibaba语音转文本同步
价格
起 $0.00009
模态
音频

Fun-ASR Realtime 简介

Fun-ASR Realtime 是阿里巴巴的流式语音识别模型:通过实时会话接收音频,边说边返回文字。它是 Fun-ASR 面向字幕、语音输入和通话辅助的变体,这类场景里用录音版 Fun-ASR 会让用户一直等到录音结束。阿里列出了热词、时间戳,以及普通话和粤语、四川话等方言的支持。

擅长的任务

  • 说话人还在讲的时候就流式返回部分文字,字幕无需等录音结束。
  • 据阿里文档,能高准确率识别普通话,也支持粤语、四川话等多种方言。
  • 自定义热词能让实时识别更偏向你产品特有的名称和术语。
  • 逐词和逐句的时间戳随流一起到达,便于对齐字幕。

什么情况换别的模型

  • 它需要 WebSocket 会话,集成工作比把录音上传给 Fun-ASR 多。
  • 实时解码无法回头重看之前的音频,需要归档级准确率时,录音版 Fun-ASR 更稳妥。

快速上手

  1. 创建 API 密钥

    在 Console 生成一把密钥,平台上的模型都能用。

  2. 发送第一个请求

    复制你所用语言的示例代码,向该端点发起请求。

    语音转文字WebSocket
    WS/v1/realtime
    // npm install ws
    import WebSocket from 'ws';
    
    const socket = new WebSocket("wss://api.tokenlab.sh/v1/realtime?model=fun-asr-realtime", {
      headers: { Authorization: "Bearer sk-xxx" }
    });
    
    socket.on('open', () => {
      // Send the input events supported by this model with socket.send(...).
      // https://tokenlab.sh/docs/en/api-reference/realtime/connect
    });
    socket.on('message', (data) => console.log(data.toString()));
    socket.on('error', (error) => console.error(error));
    socket.on('close', (code, reason) => console.log(code, reason.toString()));
    
    // Close the session when finished.
    process.on('SIGINT', () => socket.close());

价格

官方价格是模型厂商公开的基线价,TokenLab 价格是用这个模型时实际的计费价。

实时 / 语音转文字

每秒
官方价格
$0.00009
Official
$0.00009
折扣
—

用量与动态

成功率是请求完成的比例;延迟是拿到一次完整响应要花的时间,P95 表示 95% 的请求都在这个时间内完成。

用量与可用性

最近 24 小时
请求
成功率
P95 延迟
总 token 数
模型表现
达到隐私和数据量阈值后,指标才会显示。

数据来自汇总的用户请求,不含状态检查。

直接在 Console 里试

Fun-ASR Realtime 已在 Console 备好,提示词已填好,可以直接修改或发送。

帮我用 fun-asr-realtime 发起一条简短的音频请求,接口是 /v1/realtime。返回结果和费用。

使用场景

  • 实时字幕

    网络研讨会或活动现场,边讲边显示字幕,每句话稳定后更新。

  • 语音输入

    让用户对着表单或聊天框口述,边说边看到文字出现。

  • 支持方言的助手

    在等不起完整录音的应用里,处理普通话和地方方言的语音请求。

提示词示例

流式传输一场普通话产品发布会的麦克风音频,每句话结束时输出字幕。

转写一通实时的粤语客户来电,热词设为“退款”和“订单号”。

流式转写一场培训,并保留逐词时间戳,方便之后剪辑。

FAQ

什么时候选 Fun-ASR Realtime,而不是 Fun-ASR?

文字必须在说话的同时出现时选 Realtime,比如字幕或听写。已经有录制完成的音频,需要说话人分离或归档级准确率时,选录音版 Fun-ASR。

怎么把音频发给它?

通过流式 WebSocket 会话,可以用阿里的 DashScope SDK,也可以直接用原始协议。你推送音频分片,会话期间持续收到识别出的文本事件。

支持方言吗?

支持。阿里的实时识别文档列出了普通话,以及粤语、四川话等方言,另外还有可帮助识别名称和产品术语的自定义热词。方言语音和标准普通话在同一个实时会话里识别。

能处理句子之间的静音吗?

能。它带有语音活动检测,会过滤非语音音频并判断句子在哪里结束。静音阈值可在会话设置里配置,可以调整字幕多快稳定下来。

Fun-ASR Realtime 的费用是多少?

在 TokenLab 上,Fun-ASR Realtime 的价格为 $0.00009 每秒。完整明细见上方价格表。 价格因计费单位、规格和用量而异。请在模型的详细定价中对比相同条件下的费率;单一费率不代表总价。

Fun-ASR Realtime 应该使用哪个端点?

Fun-ASR Realtime 使用 https://api.tokenlab.sh/v1/realtime。代码写法见下方的请求示例。

Fun-ASR Realtime 支持哪些操作?

Fun-ASR Realtime 支持 语音转文字。选了操作,上面会显示对应的端点和请求示例。

Fun-ASR Realtime 对比

资料来源

审阅于 2026年10月2日

更多 Fun-ASR 模型

相关模型