各リクエストに対して Auto、TokenLab Verified、または Official を選択でき、価格は事前に表示されます。新機能を見る

Alibaba: Fun-ASR Realtime

Fun-ASR Realtimeは、セッションの進行に合わせて入力される音声を処理します。キャプションや音声入力など、録音の完了を待つと対話が中断されてしまうようなライブ文字起こし体験向けに設計されています。
モデルを比較
fun-asr-realtime
利用可能Alibaba音声テキスト変換同期
価格
価格 $0.00009
モダリティ
オーディオ

Fun-ASR Realtime について

Fun-ASR RealtimeはAlibabaのストリーミング音声認識モデルです。ライブセッションを通じて音声を受け取り、話している最中にテキストを返します。これはキャプション、音声入力、通話内アシスタント向けのFun-ASRのバリエーションであり、録音済み音声用のFun-ASRでは録音が終わるまで待機する必要があります。Alibabaはホットワード、タイムスタンプ、および広東語や四川語などの方言を含む中国語(マンダリン)の対応をリストしています。

得意なこと

  • 話者が話している最中に部分的なテキストをストリーミングするため、録音が完了するのを待たずにキャプションが表示されます。
  • Alibabaのドキュメントによると、中国語(マンダリン)を高精度で認識し、広東語や四川語を含むいくつかの方言にも対応しています。
  • カスタムホットワードにより、製品固有の名前や用語に向けてライブ認識を誘導します。
  • 単語および文レベルのタイムスタンプがストリームとともに届くため、キャプションの調整に役立ちます。

他のモデルを検討すべきケース

  • WebSocketセッションが必要であり、Fun-ASRへの録音アップロードよりも統合の手間がかかります。
  • ライブデコードは以前の音声に戻ることができないため、アーカイブの正確性を求める場合は録音済み音声用のFun-ASRの方が安全な選択です。

はじめに

  1. 最初のキーを作成

    Consoleでキーを作成すれば、プラットフォーム内のすべてのモデルで使えます。

  2. 最初のリクエストを送信する

    お使いの言語の例をコピーして、エンドポイントに対して実行してください。

    音声からテキストへWebSocket
    WS/v1/realtime
    // npm install ws
    import WebSocket from 'ws';
    
    const socket = new WebSocket("wss://api.tokenlab.sh/v1/realtime?model=fun-asr-realtime", {
      headers: { Authorization: "Bearer sk-xxx" }
    });
    
    socket.on('open', () => {
      // Send the input events supported by this model with socket.send(...).
      // https://tokenlab.sh/docs/en/api-reference/realtime/connect
    });
    socket.on('message', (data) => console.log(data.toString()));
    socket.on('error', (error) => console.error(error));
    socket.on('close', (code, reason) => console.log(code, reason.toString()));
    
    // Close the session when finished.
    process.on('SIGINT', () => socket.close());

料金

Official価格はモデル提供者の公開基準です。TokenLab価格はTokenLabでのご利用料金です。

リアルタイム / 音声からテキストへ

1秒あたり
公式価格
$0.00009
Official
$0.00009
割引
—

使用状況とアクティビティ

成功率は完了したリクエストの割合です。レイテンシは完全なレスポンスにかかる時間で、P95 は 95% のリクエストがその時間内に完了したことを意味します。

使用量と可用性

過去24時間
リクエスト数
成功率
P95 レイテンシ
合計トークン数
モデルパフォーマンス
プライバシーおよびデータ量のしきい値に達すると、メトリクスが表示されます。

データはステータスチェックを除外した、集計済みのユーザーリクエストに基づいています。

Consoleで開く

ConsoleでFun-ASR Realtimeを開き、プロンプトを編集・送信できます。

fun-asr-realtimeと/v1/realtimeで音声をテスト。結果とコストを表示します。

ユースケース

  • ライブキャプション

    ウェビナーやイベントで話者が話すのに合わせて字幕を表示し、文が確定するたびに更新します。

  • 音声入力

    ユーザーがフォームやチャットボックスにディクテーションを行い、話している最中に言葉が表示されるようにします。

  • 方言対応アシスタント

    完全な録音を待つことができないアプリで、中国語(マンダリン)や地域の方言による音声リクエストを処理します。

プロンプト例

中国語の製品発表会でマイク音声をストリーミングし、各文が終わるたびにキャプションを出力します。

ライブの広東語の顧客通話を、「返金」および「注文番号」というホットワードを使用して文字起こしします。

トレーニングセッションをストリーミングし、後でクリップするために単語のタイムスタンプを保持します。

FAQ

Fun-ASRの代わりにFun-ASR Realtimeを選ぶべきなのはどのような時ですか?

キャプションやディクテーションのように、音声が話されている最中にテキストを表示する必要がある場合はRealtimeを選択してください。録音が完了しており、話者分離やアーカイブの正確性を求める場合は、録音済み音声用のFun-ASRを選択してください。

どのように音声を送信すればよいですか?

AlibabaのDashScope SDKまたは生のプロトコルを通じて、ストリーミングWebSocketセッション経由で行います。音声チャンクをプッシュし、セッションの継続に合わせて認識されたテキストイベントを受け取ります。

方言はサポートされていますか?

はい。Alibabaのリアルタイムドキュメントには、中国語(マンダリン)に加え、広東語、四川語、その他の言語が、名前や製品用語に役立つカスタムホットワードとともに記載されています。方言の音声は、標準的な中国語と同じライブセッション内で認識されます。

文間の沈黙を処理できますか?

はい。音声以外の音声をフィルタリングし、文の終わりを判断する音声活動検出機能が含まれています。沈黙のしきい値はセッション設定で構成可能なため、キャプションがどれくらいの速さで確定するかを調整できます。

Fun-ASR Realtime の料金はいくらですか?

TokenLab では Fun-ASR Realtime は $0.00009 1秒あたり です。詳細は上の料金表を参照してください。 料金は課金単位・仕様・使用量によって異なります。モデルの詳細な料金で同条件同士を比較してください。単一のレートで総額は決まりません。

Fun-ASR Realtime はどのエンドポイントを使うべきですか?

Fun-ASR Realtime のデフォルトは https://api.tokenlab.sh/v1/realtime です。プロバイダーネイティブ形式に対応している場合は、API workbench にそのエンドポイントも表示されます。

Fun-ASR Realtime はどの操作に対応していますか?

Fun-ASR Realtime は 音声からテキストへ に対応しています。上の API workbench で操作を選ぶと、対応するエンドポイントとコード例が表示されます。

Fun-ASR Realtime を比較する

ソース

2026/10/02 時点での評価

Fun-ASR の他のモデル

関連モデル