為每個請求選擇 Auto、TokenLab Verified 或 Official,並預先顯示價格。查看最新動態

Alibaba: Fun-ASR Realtime

Fun-ASR Realtime 隨著會話進行處理傳入的音訊。專為即時轉錄體驗(如字幕與語音輸入)設計,避免因等待完整錄音而中斷互動。
比較模型
fun-asr-realtime
可用Alibaba語音轉文字同步
價格
起 $0.00009
模態
音訊

關於 Fun-ASR Realtime

Fun-ASR Realtime 是阿里巴巴的串流語音識別模型:它透過即時連線接收音訊,並在說話過程中回傳文字。這是適用於字幕、語音輸入及通話輔助的 Fun-ASR 變體,而錄音版 Fun-ASR 會強制使用者等待錄音結束。阿里巴巴列出了熱詞、時間戳記,以及包含粵語和四川話等方言的中文識別能力。

適用場景

  • 在說話者持續發言時串流輸出部分文字,因此字幕無需等待錄音完成即可顯示。
  • 根據阿里巴巴的文件,該模型能以高準確度識別中文,並支援包括粵語和四川話在內的多種方言。
  • 自訂熱詞可引導即時識別,使其更貼近您的產品名稱與術語。
  • 詞級與句級時間戳記會隨串流一同傳回,有助於字幕對齊。

其他選擇建議

  • 它需要 WebSocket 連線,整合工作量比上傳錄音至 Fun-ASR 更大。
  • 即時解碼無法回溯先前的音訊,因此若追求存檔準確度,錄音版 Fun-ASR 是更穩妥的選擇。

入門指南

  1. 建立 API 金鑰

    請至 Console 建立金鑰,即可在平台上使用各類模型。

  2. 發送您的第一個請求

    複製您所選語言的範例,並針對端點執行它。

    語音轉文字WebSocket
    WS/v1/realtime
    // npm install ws
    import WebSocket from 'ws';
    
    const socket = new WebSocket("wss://api.tokenlab.sh/v1/realtime?model=fun-asr-realtime", {
      headers: { Authorization: "Bearer sk-xxx" }
    });
    
    socket.on('open', () => {
      // Send the input events supported by this model with socket.send(...).
      // https://tokenlab.sh/docs/en/api-reference/realtime/connect
    });
    socket.on('message', (data) => console.log(data.toString()));
    socket.on('error', (error) => console.error(error));
    socket.on('close', (code, reason) => console.log(code, reason.toString()));
    
    // Close the session when finished.
    process.on('SIGINT', () => socket.close());

定價

Official 價格為模型開發商的公開基準價。TokenLab 價格則為您在 TokenLab 使用該模型的實際費用。

即時 / 語音轉文字

每秒
Official 定價
$0.00009
Official
$0.00009
折扣
—

使用量與活動

成功率是請求完成的比例;延遲是一次完整回應所需的時間,P95 表示 95% 的請求在該時間內完成。

用量與可用性

過去 24 小時
請求數
成功率
P95 延遲
總 Token 用量
模型效能
當達到隱私權與資料量的門檻後,指標才會顯示。

資料基於彙總的使用者請求,不包含狀態檢查。

直接在 Console 裡試

在 Console 中開啟 Fun-ASR Realtime,並準備好編輯或發送提示詞。

協助我使用 fun-asr-realtime 透過 /v1/realtime 進行音訊請求,並顯示結果與成本。

應用情境

  • 即時字幕

    在網路研討會或活動中,隨著說話者發言顯示字幕,並在句子確認後進行更新。

  • 語音輸入

    讓使用者對著表單或聊天框聽寫,並在說話時即時看到文字出現。

  • 方言感知助理

    在無法等待完整錄音的應用程式中,處理中文及區域方言的語音請求。

提示詞範例

為中文產品發表會串流麥克風音訊,並在每個句子結束時列印字幕。

轉錄一場即時粵語客戶通話,並使用「退款」與「訂單編號」作為熱詞。

串流訓練課程並保留詞級時間戳記,以供後續剪輯使用。

FAQ

我該何時選擇 Fun-ASR Realtime 而非 Fun-ASR?

當文字必須在音訊說話的同時顯示(如字幕或聽寫)時,請選擇 Realtime。當您已有錄音檔案並需要說話者分離 (diarization) 或存檔準確度時,請選擇錄音版 Fun-ASR。

我該如何傳送音訊給它?

透過串流 WebSocket 連線,可使用阿里巴巴的 DashScope SDK 或原始協定。您推送音訊區塊,並在連線持續期間接收識別出的文字事件。

它支援方言嗎?

支援。阿里巴巴的即時識別文件列出了中文以及粵語、四川話和其他方言,並支援有助於識別名稱與產品術語的自訂熱詞。方言識別與標準中文在同一個即時連線中進行。

它能處理句子間的靜音嗎?

可以,它包含語音活動偵測 (VAD),可過濾非語音音訊並判斷句子結束位置。靜音閾值可在連線設定中調整,因此您可以微調字幕顯示的速度。

Fun-ASR Realtime 的費用是多少?

在 TokenLab 上,Fun-ASR Realtime 價格為 $0.00009 每秒。完整明細見上方價格表。 價格因計費單位、規格和用量而異。請在模型的詳細定價中比較相同條件下的費率;單一費率不代表總價。

Fun-ASR Realtime 應該使用哪一個端點?

請使用 https://api.tokenlab.sh/v1/realtime 進行 Fun-ASR Realtime 的呼叫。下方的請求範例展示了對應的程式碼格式。

Fun-ASR Realtime 支援哪些操作?

Fun-ASR Realtime 支援 語音轉文字。請在上方選擇一項操作以查看其端點與請求範例。

比較 Fun-ASR Realtime

來源

更新於 2026年10月2日

更多來自 Fun-ASR 的模型

相關模型