Alibaba: Paraformer v2
paraformer-v2- 価格
- 価格 $0.000012
- モダリティ
- オーディオ
Paraformer v2 について
Paraformer v2は、会議や長時間の会話のオフライン文字起こしを行うためのAlibabaのファイルベース音声認識モデルです。最大2GB、12時間までの録音データに対して非同期で呼び出されます。Paraformer 8K v2と比較すると、一般的な広帯域オーディオ向けであり、リアルタイムモデルと比較した場合は、即時性の代わりに話者分離(ダイアライゼーション)やホットワードを含む完全な文字起こしを提供します。
得意なこと
- Alibabaのドキュメントに基づき、1ファイルあたり最大12時間または2GBまでの非常に長い録音データを処理できます。
- タイムスタンプは常に含まれるため、取得するために特別なオプションは不要です。
- 話者分離機能により、会議やグループディスカッションの参加者を識別します。
- 機密ワードフィルタリング機能により、文字起こしテキスト内の指定された用語をマスクできます。
他のモデルを検討すべきケース
- 結果はジョブ完了後に取得されます。ライブキャプションが必要な場合は、Paraformer Realtime v2を使用してください。
- 8kHzの電話録音には、8Kバリアントの方が音声に適合します。
はじめに
最初のキーを作成
Consoleでキーを作成すれば、プラットフォーム内のすべてのモデルで使えます。
最初のリクエストを送信する
お使いの言語の例をコピーして、エンドポイントに対して実行してください。
音声からテキストへTokenLab エンドポイントPOST/v1/audio/transcriptionscurl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \ -H "Authorization: Bearer sk-xxx" \ -F file="@audio.mp3" \ -F operation="stt" \ -F response_format="json" \ -F model="paraformer-v2" \ -F language="en"
料金
Official価格はモデル提供者の公開基準です。TokenLab価格はTokenLabでのご利用料金です。
音声からテキストへ
1秒あたり- 公式価格
- $0.00001176
- Official
- $0.00001176
- 割引
- —
| 公式価格1秒あたり | Official1秒あたり | 割引 | |
|---|---|---|---|
| 音声からテキストへ | $0.00001176 | $0.00001176 | — |
使用状況とアクティビティ
成功率は完了したリクエストの割合です。レイテンシは完全なレスポンスにかかる時間で、P95 は 95% のリクエストがその時間内に完了したことを意味します。
使用量と可用性
過去24時間- リクエスト数
- 成功率
- P95 レイテンシ
- 合計トークン数
データはステータスチェックを除外した、集計済みのユーザーリクエストに基づいています。
Consoleで開く
ConsoleでParaformer v2を開き、プロンプトを編集・送信できます。
paraformer-v2と/v1/audio/transcriptionsで音声をテスト。結果とコストを表示します。
ユースケース
会議アーカイブ
保存された会議の録音データを、話者ラベルとタイムスタンプ付きの検索可能なテキストに変換します。
講義の文字起こし
数時間にわたる講義を一度文字起こしし、そのテキストを学生向けにインデックス化や要約を行います。
コンテンツモデレーションの準備
文字起こしされたテキストをチーム内で共有する前に、設定された機密ワードをマスクします。
プロンプト例
この3時間の全社ミーティングの録音を、話者ラベルとタイムスタンプ付きで文字起こしします。
この講義動画の音声を文字起こしし、指定された機密ワードをマスクします。
これらの毎週のスタンドアップミーティングの録音を、プロジェクト名をホットワードとして使用して文字起こしします。
FAQ
Paraformer v2は何に適していますか?
録音された会議、インタビュー、会話のオフライン文字起こしです。主要な音声および動画フォーマットを任意のサンプルレートで受け付け、タイムスタンプ付きのテキストを返します。
入力サイズの上限はどのくらいですか?
AlibabaのParaformerファイルモデルでは、最大2GB、12時間までのファイルが規定されています。これを超える場合は、文字起こしを送信する前に分割してください。
タイムスタンプをオフにできますか?
いいえ。Alibabaによると、Paraformerではタイムスタンプが常時有効であるため、すべての文字起こしに含まれます。時間位置を取得するためのリクエストオプションは不要です。
Paraformer v2とFun-ASRのどちらが良いですか?
どちらも話者分離とホットワードを使用してファイルを文字起こしします。Fun-ASRは新しいラインであり、Paraformer v2は実績のあるモデルです。それぞれのモデルで音声サンプルを処理し、重要視するエラーの傾向を比較してください。
Paraformer v2 の料金はいくらですか?
TokenLab では Paraformer v2 は $0.00001176 1秒あたり です。詳細は上の料金表を参照してください。 料金は課金単位・仕様・使用量によって異なります。モデルの詳細な料金で同条件同士を比較してください。単一のレートで総額は決まりません。
Paraformer v2 はどのエンドポイントを使うべきですか?
Paraformer v2 のデフォルトは https://api.tokenlab.sh/v1/audio/transcriptions です。プロバイダーネイティブ形式に対応している場合は、API workbench にそのエンドポイントも表示されます。
Paraformer v2 はどの操作に対応していますか?
Paraformer v2 は 音声からテキストへ に対応しています。上の API workbench で操作を選ぶと、対応するエンドポイントとコード例が表示されます。
Paraformer v2 を比較する
ソース
- Model Studio: recording file recognition models
- Model Studio: speech-to-text models for real-time and file transcription
2026/10/02 時点での評価