Alibaba: Paraformer Realtime v2
paraformer-realtime-v2- 价格
- 起 $0.000035
- 模态
- 音频
Paraformer Realtime v2 简介
Paraformer Realtime v2 是阿里巴巴的通用流式语音识别模型,音频还在传入时就返回文字。它面向字幕、语音输入和会议界面,这些场景中转写应随着人们继续说话而更新。它不像 8K 版本那样限于电话带宽,也不像 Fun-ASR Realtime,它属于较早的 Paraformer 系列。
擅长的任务
- 持续更新转写内容,适合实时字幕和会议屏幕。
- 适用于耳机、会议室麦克风等通用宽带音频,不局限于电话线路。
- 支持热词,适合你的会话里经常出现的人名和术语。
- 流式结果附带时间戳,方便对齐字幕。
什么情况换别的模型
- 电话质量的 8 kHz 音频更适合用 Paraformer Realtime 8K v2。
- 流式意味着不会对音频做第二遍处理,最终准确率最重要时请用文件模型。
快速上手
创建 API 密钥
在 Console 生成一把密钥,平台上的模型都能用。
发送第一个请求
复制你所用语言的示例代码,向该端点发起请求。
语音转文字WebSocketWS/v1/realtime// npm install ws import WebSocket from 'ws'; const socket = new WebSocket("wss://api.tokenlab.sh/v1/realtime?model=paraformer-realtime-v2", { headers: { Authorization: "Bearer sk-xxx" } }); socket.on('open', () => { // Send the input events supported by this model with socket.send(...). // https://tokenlab.sh/docs/en/api-reference/realtime/connect }); socket.on('message', (data) => console.log(data.toString())); socket.on('error', (error) => console.error(error)); socket.on('close', (code, reason) => console.log(code, reason.toString())); // Close the session when finished. process.on('SIGINT', () => socket.close());
价格
官方价格是模型厂商公开的基线价,TokenLab 价格是用这个模型时实际的计费价。
实时 / 语音转文字
每秒- 官方价格
- $0.00003529
- Official
- $0.00003529
- 折扣
- —
| 官方价格每秒 | Official每秒 | 折扣 | |
|---|---|---|---|
| 实时 / 语音转文字 | $0.00003529 | $0.00003529 | — |
用量与动态
成功率是请求完成的比例;延迟是拿到一次完整响应要花的时间,P95 表示 95% 的请求都在这个时间内完成。
用量与可用性
最近 24 小时- 请求
- 成功率
- P95 延迟
- 总 token 数
数据来自汇总的用户请求,不含状态检查。
直接在 Console 里试
Paraformer Realtime v2 已在 Console 备好,提示词已填好,可以直接修改或发送。
帮我用 paraformer-realtime-v2 发起一条简短的音频请求,接口是 /v1/realtime。返回结果和费用。
使用场景
会议字幕
在视频会议中显示实时转写,让参会者跟得上,或补上漏听的词。
语音输入
用户说话的同时,把听写内容转成编辑器或表单里的文字。
现场活动字幕
给演讲或直播加字幕,讲话人说完一句就更新一句。
提示词示例
对这段实时会议音频做流式识别,有人说话就显示字幕。
语音听写一张客服工单,我说话的同时把文字填进文本框。
对大会主题演讲做流式识别,使用讲者和产品名称的热词。
FAQ
Paraformer Realtime v2 是用于电话通话的吗?
主要不是。8 kHz 电话音频阿里巴巴提供的是 Paraformer Realtime 8K v2。这个模型面向来自麦克风、耳机和会议软件的通用实时音频。
它和 Fun-ASR Realtime 相比如何?
两者都是流式的。Fun-ASR Realtime 属于较新的 Fun-ASR 系列,列有方言支持;Paraformer Realtime v2 是成熟的 Paraformer 选项。用你的音频两个都测一下,留下更合适的。
怎么集成?
通过 DashScope SDK 或原始协议建立 WebSocket 会话。客户端分块发送音频,会话保持打开期间持续收到识别事件。
能转写已经录好的文件吗?
它是为流式设计的。已录好的录音请用 Paraformer v2,也就是基于文件的对应模型,它会处理整个文件,每条结果都带时间戳。
Paraformer Realtime v2 的费用是多少?
在 TokenLab 上,Paraformer Realtime v2 的价格为 $0.00003529 每秒。完整明细见上方价格表。 价格因计费单位、规格和用量而异。请在模型的详细定价中对比相同条件下的费率;单一费率不代表总价。
Paraformer Realtime v2 应该使用哪个端点?
Paraformer Realtime v2 使用 https://api.tokenlab.sh/v1/realtime。代码写法见下方的请求示例。
Paraformer Realtime v2 支持哪些操作?
Paraformer Realtime v2 支持 语音转文字。选了操作,上面会显示对应的端点和请求示例。
Paraformer Realtime v2 对比
资料来源
- Model Studio: real-time speech recognition
- Model Studio: speech-to-text models for real-time and file transcription
审阅于 2026年10月2日