Alibaba: Paraformer v2
paraformer-v2- 价格
- 起 $0.000012
- 模态
- 音频
Paraformer v2 简介
Paraformer v2 是阿里巴巴基于文件的语音识别模型,用于会议和长对话的离线转写。它以异步方式调用,支持最大 2 GB、12 小时的录音。与 Paraformer 8K v2 相比,它面向通用宽带音频;与实时模型相比,它放弃即时性,换来带说话人分离和热词的完整转写。
擅长的任务
- 能处理很长的录音,据阿里巴巴文档,单个文件最长 12 小时或 2 GB。
- 始终包含时间戳,不需要额外选项就能拿到。
- 说话人分离能在会议和小组讨论中区分不同的参与者。
- 敏感词过滤可以屏蔽转写文本里列出的词。
什么情况换别的模型
- 任务完成后才返回结果,实时字幕需要用 Paraformer Realtime v2。
- 8 kHz 电话录音用 8K 版本更匹配。
快速上手
创建 API 密钥
在 Console 生成一把密钥,平台上的模型都能用。
发送第一个请求
复制你所用语言的示例代码,向该端点发起请求。
语音转文字TokenLab 端点POST/v1/audio/transcriptionscurl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \ -H "Authorization: Bearer sk-xxx" \ -F file="@audio.mp3" \ -F operation="stt" \ -F response_format="json" \ -F model="paraformer-v2" \ -F language="en"
价格
官方价格是模型厂商公开的基线价,TokenLab 价格是用这个模型时实际的计费价。
语音转文字
每秒- 官方价格
- $0.00001176
- Official
- $0.00001176
- 折扣
- —
| 官方价格每秒 | Official每秒 | 折扣 | |
|---|---|---|---|
| 语音转文字 | $0.00001176 | $0.00001176 | — |
用量与动态
成功率是请求完成的比例;延迟是拿到一次完整响应要花的时间,P95 表示 95% 的请求都在这个时间内完成。
用量与可用性
最近 24 小时- 请求
- 成功率
- P95 延迟
- 总 token 数
数据来自汇总的用户请求,不含状态检查。
直接在 Console 里试
Paraformer v2 已在 Console 备好,提示词已填好,可以直接修改或发送。
帮我用 paraformer-v2 发起一条简短的音频请求,接口是 /v1/audio/transcriptions。返回结果和费用。
使用场景
会议归档
把保存的会议录音处理成可搜索的文字,带说话人标签和时间戳。
讲座转写
把数小时的讲座转写一次,再为学生做索引或总结。
内容审核准备
在转写稿分享给更多人之前,屏蔽配置好的敏感词。
提示词示例
转写这段 3 小时的全员会议录音,带说话人标签和时间戳。
转写这段讲座视频的音频,并屏蔽列出的敏感词。
转写这些每周站会录音,使用我们项目名称的热词。
FAQ
Paraformer v2 最适合做什么?
对已录好的会议、访谈和对话做离线转写。它接受主流音视频格式和任意采样率,返回文字和时间戳。
输入文件最大多大?
阿里巴巴文档给 Paraformer 文件模型的上限是 2 GB 和 12 小时。更长的内容请先拆成几段再提交转写。
可以关掉时间戳吗?
不可以。阿里巴巴说明 Paraformer 的时间戳是常开的,所以每份转写都带有时间戳,请求里也不需要任何选项就能拿到时间位置。
Paraformer v2 还是 Fun-ASR?
两者都能转写文件,都支持说话人分离和热词。Fun-ASR 是较新的系列,Paraformer v2 是成熟的系列。各拿一段你的音频跑一遍,对比你在意的错误。
Paraformer v2 的费用是多少?
在 TokenLab 上,Paraformer v2 的价格为 $0.00001176 每秒。完整明细见上方价格表。 价格因计费单位、规格和用量而异。请在模型的详细定价中对比相同条件下的费率;单一费率不代表总价。
Paraformer v2 应该使用哪个端点?
Paraformer v2 使用 https://api.tokenlab.sh/v1/audio/transcriptions。代码写法见下方的请求示例。
Paraformer v2 支持哪些操作?
Paraformer v2 支持 语音转文字。选了操作,上面会显示对应的端点和请求示例。
Paraformer v2 对比
资料来源
- Model Studio: recording file recognition models
- Model Studio: speech-to-text models for real-time and file transcription
审阅于 2026年10月2日