Alibaba: Paraformer Realtime v2
paraformer-realtime-v2- 価格
- 価格 $0.000035
- モダリティ
- オーディオ
Paraformer Realtime v2 について
Paraformer Realtime v2は、Alibabaの汎用ストリーミング音声認識モデルであり、音声の入力中にテキストを返します。キャプション、音声入力、および会話が続く中でトランスクリプトを更新する必要がある会議インターフェースを対象としています。8Kバリアントとは異なり電話帯域幅に限定されず、Fun-ASR Realtimeとは異なり、従来のParaformerラインに属しています。
得意なこと
- トランスクリプトを継続的に更新するため、ライブキャプションや会議画面に適しています。
- 電話回線だけでなく、ヘッドセットや会議用マイクなどの一般的な広帯域音声で動作します。
- セッションで頻繁に使用される名前や用語のホットワードをサポートしています。
- キャプションを同期させるためのタイムスタンプをストリーミング結果と共に提供します。
他のモデルを検討すべきケース
- 電話品質の8 kHz音声には、Paraformer Realtime 8K v2の方が適しています。
- ストリーミングは音声の二重処理を行わないため、最終的な精度が重要な場合はファイルモデルを使用してください。
はじめに
最初のキーを作成
Consoleでキーを作成すれば、プラットフォーム内のすべてのモデルで使えます。
最初のリクエストを送信する
お使いの言語の例をコピーして、エンドポイントに対して実行してください。
音声からテキストへWebSocketWS/v1/realtime// npm install ws import WebSocket from 'ws'; const socket = new WebSocket("wss://api.tokenlab.sh/v1/realtime?model=paraformer-realtime-v2", { headers: { Authorization: "Bearer sk-xxx" } }); socket.on('open', () => { // Send the input events supported by this model with socket.send(...). // https://tokenlab.sh/docs/en/api-reference/realtime/connect }); socket.on('message', (data) => console.log(data.toString())); socket.on('error', (error) => console.error(error)); socket.on('close', (code, reason) => console.log(code, reason.toString())); // Close the session when finished. process.on('SIGINT', () => socket.close());
料金
Official価格はモデル提供者の公開基準です。TokenLab価格はTokenLabでのご利用料金です。
リアルタイム / 音声からテキストへ
1秒あたり- 公式価格
- $0.00003529
- Official
- $0.00003529
- 割引
- —
| 公式価格1秒あたり | Official1秒あたり | 割引 | |
|---|---|---|---|
| リアルタイム / 音声からテキストへ | $0.00003529 | $0.00003529 | — |
使用状況とアクティビティ
成功率は完了したリクエストの割合です。レイテンシは完全なレスポンスにかかる時間で、P95 は 95% のリクエストがその時間内に完了したことを意味します。
使用量と可用性
過去24時間- リクエスト数
- 成功率
- P95 レイテンシ
- 合計トークン数
データはステータスチェックを除外した、集計済みのユーザーリクエストに基づいています。
Consoleで開く
ConsoleでParaformer Realtime v2を開き、プロンプトを編集・送信できます。
paraformer-realtime-v2と/v1/realtimeで音声をテスト。結果とコストを表示します。
ユースケース
会議のキャプション
ビデオ会議中にライブトランスクリプトを表示し、参加者が内容を追跡したり、聞き逃した言葉を確認したりできるようにします。
音声タイピング
ユーザーが話す内容を、エディタやフォームのテキストにリアルタイムで変換します。
ライブイベントの字幕
講演や放送に字幕を追加し、話者が話し終えるたびに各文を更新します。
プロンプト例
このライブ会議音声をストリーミングし、話者が話す内容に合わせてキャプションを表示します。
サポートチケットの内容を音声で指示し、話しながらテキストボックスを埋めます。
カンファレンスの基調講演をストリーミングし、講演者名や製品名をホットワードとして設定します。
FAQ
Paraformer Realtime v2は電話通話用ですか?
主目的ではありません。8 kHzの電話音声には、AlibabaはParaformer Realtime 8K v2を提供しています。本モデルは、マイク、ヘッドセット、会議ソフトウェアからの一般的なライブ音声を対象としています。
Fun-ASR Realtimeとの比較はどうですか?
どちらもストリーミングに対応しています。Fun-ASR Realtimeは方言サポートが明記された新しいFun-ASRラインであり、Paraformer Realtime v2は確立されたParaformerの選択肢です。両方を音声でテストし、適したものを選んでください。
統合方法は?
DashScope SDKまたはRawプロトコルを介したWebSocketセッションです。クライアントが音声チャンクを送信し、セッションが開いている間、認識イベントが継続的に返されます。
完成したファイルを文字起こしできますか?
ストリーム用に設計されています。完成した録音データには、ファイル全体を処理して結果ごとにタイムスタンプを返す、ファイルベースの対応モデルであるParaformer v2を使用してください。
Paraformer Realtime v2 の料金はいくらですか?
TokenLab では Paraformer Realtime v2 は $0.00003529 1秒あたり です。詳細は上の料金表を参照してください。 料金は課金単位・仕様・使用量によって異なります。モデルの詳細な料金で同条件同士を比較してください。単一のレートで総額は決まりません。
Paraformer Realtime v2 はどのエンドポイントを使うべきですか?
Paraformer Realtime v2 のデフォルトは https://api.tokenlab.sh/v1/realtime です。プロバイダーネイティブ形式に対応している場合は、API workbench にそのエンドポイントも表示されます。
Paraformer Realtime v2 はどの操作に対応していますか?
Paraformer Realtime v2 は 音声からテキストへ に対応しています。上の API workbench で操作を選ぶと、対応するエンドポイントとコード例が表示されます。
Paraformer Realtime v2 を比較する
ソース
- Model Studio: real-time speech recognition
- Model Studio: speech-to-text models for real-time and file transcription
2026/10/02 時点での評価