每次请求可选择 Auto、TokenLab Verified 或 Official,并查看对应价格。查看更新

Alibaba: Paraformer v2

Paraformer v2 面向录音文件的离线转写,适合会议存档和较长对话录音,在会话结束后整理出可重复利用的文字稿。
对比模型
paraformer-v2
可用Alibaba语音转文本同步 / 异步
价格
起 $0.000012
模态
音频

Paraformer v2 简介

Paraformer v2 是阿里巴巴基于文件的语音识别模型,用于会议和长对话的离线转写。它以异步方式调用,支持最大 2 GB、12 小时的录音。与 Paraformer 8K v2 相比,它面向通用宽带音频;与实时模型相比,它放弃即时性,换来带说话人分离和热词的完整转写。

擅长的任务

  • 能处理很长的录音,据阿里巴巴文档,单个文件最长 12 小时或 2 GB。
  • 始终包含时间戳,不需要额外选项就能拿到。
  • 说话人分离能在会议和小组讨论中区分不同的参与者。
  • 敏感词过滤可以屏蔽转写文本里列出的词。

什么情况换别的模型

  • 任务完成后才返回结果,实时字幕需要用 Paraformer Realtime v2。
  • 8 kHz 电话录音用 8K 版本更匹配。

快速上手

  1. 创建 API 密钥

    在 Console 生成一把密钥,平台上的模型都能用。

  2. 发送第一个请求

    复制你所用语言的示例代码,向该端点发起请求。

    语音转文字TokenLab 端点
    POST/v1/audio/transcriptions
    curl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \
      -H "Authorization: Bearer sk-xxx" \
      -F file="@audio.mp3" \
      -F operation="stt" \
      -F response_format="json" \
      -F model="paraformer-v2" \
      -F language="en"

价格

官方价格是模型厂商公开的基线价,TokenLab 价格是用这个模型时实际的计费价。

语音转文字

每秒
官方价格
$0.00001176
Official
$0.00001176
折扣
—

用量与动态

成功率是请求完成的比例;延迟是拿到一次完整响应要花的时间,P95 表示 95% 的请求都在这个时间内完成。

用量与可用性

最近 24 小时
请求
成功率
P95 延迟
总 token 数
模型表现
达到隐私和数据量阈值后,指标才会显示。

数据来自汇总的用户请求,不含状态检查。

直接在 Console 里试

Paraformer v2 已在 Console 备好,提示词已填好,可以直接修改或发送。

帮我用 paraformer-v2 发起一条简短的音频请求,接口是 /v1/audio/transcriptions。返回结果和费用。

使用场景

  • 会议归档

    把保存的会议录音处理成可搜索的文字,带说话人标签和时间戳。

  • 讲座转写

    把数小时的讲座转写一次,再为学生做索引或总结。

  • 内容审核准备

    在转写稿分享给更多人之前,屏蔽配置好的敏感词。

提示词示例

转写这段 3 小时的全员会议录音,带说话人标签和时间戳。

转写这段讲座视频的音频,并屏蔽列出的敏感词。

转写这些每周站会录音,使用我们项目名称的热词。

FAQ

Paraformer v2 最适合做什么?

对已录好的会议、访谈和对话做离线转写。它接受主流音视频格式和任意采样率,返回文字和时间戳。

输入文件最大多大?

阿里巴巴文档给 Paraformer 文件模型的上限是 2 GB 和 12 小时。更长的内容请先拆成几段再提交转写。

可以关掉时间戳吗?

不可以。阿里巴巴说明 Paraformer 的时间戳是常开的,所以每份转写都带有时间戳,请求里也不需要任何选项就能拿到时间位置。

Paraformer v2 还是 Fun-ASR?

两者都能转写文件,都支持说话人分离和热词。Fun-ASR 是较新的系列,Paraformer v2 是成熟的系列。各拿一段你的音频跑一遍,对比你在意的错误。

Paraformer v2 的费用是多少?

在 TokenLab 上,Paraformer v2 的价格为 $0.00001176 每秒。完整明细见上方价格表。 价格因计费单位、规格和用量而异。请在模型的详细定价中对比相同条件下的费率;单一费率不代表总价。

Paraformer v2 应该使用哪个端点?

Paraformer v2 使用 https://api.tokenlab.sh/v1/audio/transcriptions。代码写法见下方的请求示例。

Paraformer v2 支持哪些操作?

Paraformer v2 支持 语音转文字。选了操作,上面会显示对应的端点和请求示例。

Paraformer v2 对比

资料来源

审阅于 2026年10月2日

更多 Paraformer 模型

相关模型