每次请求可选择 Auto、TokenLab Verified 或 Official,并查看对应价格。查看更新

Alibaba: Paraformer Realtime v2

Paraformer Realtime v2 提供流式语音识别,适合实时字幕、口语输入和会议界面,在讲话持续进行时更新文字内容。
对比模型
paraformer-realtime-v2
可用Alibaba语音转文本同步
价格
起 $0.000035
模态
音频

Paraformer Realtime v2 简介

Paraformer Realtime v2 是阿里巴巴的通用流式语音识别模型,音频还在传入时就返回文字。它面向字幕、语音输入和会议界面,这些场景中转写应随着人们继续说话而更新。它不像 8K 版本那样限于电话带宽,也不像 Fun-ASR Realtime,它属于较早的 Paraformer 系列。

擅长的任务

  • 持续更新转写内容,适合实时字幕和会议屏幕。
  • 适用于耳机、会议室麦克风等通用宽带音频,不局限于电话线路。
  • 支持热词,适合你的会话里经常出现的人名和术语。
  • 流式结果附带时间戳,方便对齐字幕。

什么情况换别的模型

  • 电话质量的 8 kHz 音频更适合用 Paraformer Realtime 8K v2。
  • 流式意味着不会对音频做第二遍处理,最终准确率最重要时请用文件模型。

快速上手

  1. 创建 API 密钥

    在 Console 生成一把密钥,平台上的模型都能用。

  2. 发送第一个请求

    复制你所用语言的示例代码,向该端点发起请求。

    语音转文字WebSocket
    WS/v1/realtime
    // npm install ws
    import WebSocket from 'ws';
    
    const socket = new WebSocket("wss://api.tokenlab.sh/v1/realtime?model=paraformer-realtime-v2", {
      headers: { Authorization: "Bearer sk-xxx" }
    });
    
    socket.on('open', () => {
      // Send the input events supported by this model with socket.send(...).
      // https://tokenlab.sh/docs/en/api-reference/realtime/connect
    });
    socket.on('message', (data) => console.log(data.toString()));
    socket.on('error', (error) => console.error(error));
    socket.on('close', (code, reason) => console.log(code, reason.toString()));
    
    // Close the session when finished.
    process.on('SIGINT', () => socket.close());

价格

官方价格是模型厂商公开的基线价,TokenLab 价格是用这个模型时实际的计费价。

实时 / 语音转文字

每秒
官方价格
$0.00003529
Official
$0.00003529
折扣
—

用量与动态

成功率是请求完成的比例;延迟是拿到一次完整响应要花的时间,P95 表示 95% 的请求都在这个时间内完成。

用量与可用性

最近 24 小时
请求
成功率
P95 延迟
总 token 数
模型表现
达到隐私和数据量阈值后,指标才会显示。

数据来自汇总的用户请求,不含状态检查。

直接在 Console 里试

Paraformer Realtime v2 已在 Console 备好,提示词已填好,可以直接修改或发送。

帮我用 paraformer-realtime-v2 发起一条简短的音频请求,接口是 /v1/realtime。返回结果和费用。

使用场景

  • 会议字幕

    在视频会议中显示实时转写,让参会者跟得上,或补上漏听的词。

  • 语音输入

    用户说话的同时,把听写内容转成编辑器或表单里的文字。

  • 现场活动字幕

    给演讲或直播加字幕,讲话人说完一句就更新一句。

提示词示例

对这段实时会议音频做流式识别,有人说话就显示字幕。

语音听写一张客服工单,我说话的同时把文字填进文本框。

对大会主题演讲做流式识别,使用讲者和产品名称的热词。

FAQ

Paraformer Realtime v2 是用于电话通话的吗?

主要不是。8 kHz 电话音频阿里巴巴提供的是 Paraformer Realtime 8K v2。这个模型面向来自麦克风、耳机和会议软件的通用实时音频。

它和 Fun-ASR Realtime 相比如何?

两者都是流式的。Fun-ASR Realtime 属于较新的 Fun-ASR 系列,列有方言支持;Paraformer Realtime v2 是成熟的 Paraformer 选项。用你的音频两个都测一下,留下更合适的。

怎么集成?

通过 DashScope SDK 或原始协议建立 WebSocket 会话。客户端分块发送音频,会话保持打开期间持续收到识别事件。

能转写已经录好的文件吗?

它是为流式设计的。已录好的录音请用 Paraformer v2,也就是基于文件的对应模型,它会处理整个文件,每条结果都带时间戳。

Paraformer Realtime v2 的费用是多少?

在 TokenLab 上,Paraformer Realtime v2 的价格为 $0.00003529 每秒。完整明细见上方价格表。 价格因计费单位、规格和用量而异。请在模型的详细定价中对比相同条件下的费率;单一费率不代表总价。

Paraformer Realtime v2 应该使用哪个端点?

Paraformer Realtime v2 使用 https://api.tokenlab.sh/v1/realtime。代码写法见下方的请求示例。

Paraformer Realtime v2 支持哪些操作?

Paraformer Realtime v2 支持 语音转文字。选了操作,上面会显示对应的端点和请求示例。

Paraformer Realtime v2 对比

资料来源

审阅于 2026年10月2日

更多 Paraformer 模型

相关模型