Alibaba: Fun-ASR Realtime
fun-asr-realtime- 價格
- 起 $0.00009
- 模態
- 音訊
關於 Fun-ASR Realtime
Fun-ASR Realtime 是阿里巴巴的串流語音識別模型:它透過即時連線接收音訊,並在說話過程中回傳文字。這是適用於字幕、語音輸入及通話輔助的 Fun-ASR 變體,而錄音版 Fun-ASR 會強制使用者等待錄音結束。阿里巴巴列出了熱詞、時間戳記,以及包含粵語和四川話等方言的中文識別能力。
適用場景
- 在說話者持續發言時串流輸出部分文字,因此字幕無需等待錄音完成即可顯示。
- 根據阿里巴巴的文件,該模型能以高準確度識別中文,並支援包括粵語和四川話在內的多種方言。
- 自訂熱詞可引導即時識別,使其更貼近您的產品名稱與術語。
- 詞級與句級時間戳記會隨串流一同傳回,有助於字幕對齊。
其他選擇建議
- 它需要 WebSocket 連線,整合工作量比上傳錄音至 Fun-ASR 更大。
- 即時解碼無法回溯先前的音訊,因此若追求存檔準確度,錄音版 Fun-ASR 是更穩妥的選擇。
入門指南
建立 API 金鑰
請至 Console 建立金鑰,即可在平台上使用各類模型。
發送您的第一個請求
複製您所選語言的範例,並針對端點執行它。
語音轉文字WebSocketWS/v1/realtime// npm install ws import WebSocket from 'ws'; const socket = new WebSocket("wss://api.tokenlab.sh/v1/realtime?model=fun-asr-realtime", { headers: { Authorization: "Bearer sk-xxx" } }); socket.on('open', () => { // Send the input events supported by this model with socket.send(...). // https://tokenlab.sh/docs/en/api-reference/realtime/connect }); socket.on('message', (data) => console.log(data.toString())); socket.on('error', (error) => console.error(error)); socket.on('close', (code, reason) => console.log(code, reason.toString())); // Close the session when finished. process.on('SIGINT', () => socket.close());
定價
Official 價格為模型開發商的公開基準價。TokenLab 價格則為您在 TokenLab 使用該模型的實際費用。
即時 / 語音轉文字
每秒- Official 定價
- $0.00009
- Official
- $0.00009
- 折扣
- —
| Official 定價每秒 | Official每秒 | 折扣 | |
|---|---|---|---|
| 即時 / 語音轉文字 | $0.00009 | $0.00009 | — |
使用量與活動
成功率是請求完成的比例;延遲是一次完整回應所需的時間,P95 表示 95% 的請求在該時間內完成。
用量與可用性
過去 24 小時- 請求數
- 成功率
- P95 延遲
- 總 Token 用量
資料基於彙總的使用者請求,不包含狀態檢查。
直接在 Console 裡試
在 Console 中開啟 Fun-ASR Realtime,並準備好編輯或發送提示詞。
協助我使用 fun-asr-realtime 透過 /v1/realtime 進行音訊請求,並顯示結果與成本。
應用情境
即時字幕
在網路研討會或活動中,隨著說話者發言顯示字幕,並在句子確認後進行更新。
語音輸入
讓使用者對著表單或聊天框聽寫,並在說話時即時看到文字出現。
方言感知助理
在無法等待完整錄音的應用程式中,處理中文及區域方言的語音請求。
提示詞範例
為中文產品發表會串流麥克風音訊,並在每個句子結束時列印字幕。
轉錄一場即時粵語客戶通話,並使用「退款」與「訂單編號」作為熱詞。
串流訓練課程並保留詞級時間戳記,以供後續剪輯使用。
FAQ
我該何時選擇 Fun-ASR Realtime 而非 Fun-ASR?
當文字必須在音訊說話的同時顯示(如字幕或聽寫)時,請選擇 Realtime。當您已有錄音檔案並需要說話者分離 (diarization) 或存檔準確度時,請選擇錄音版 Fun-ASR。
我該如何傳送音訊給它?
透過串流 WebSocket 連線,可使用阿里巴巴的 DashScope SDK 或原始協定。您推送音訊區塊,並在連線持續期間接收識別出的文字事件。
它支援方言嗎?
支援。阿里巴巴的即時識別文件列出了中文以及粵語、四川話和其他方言,並支援有助於識別名稱與產品術語的自訂熱詞。方言識別與標準中文在同一個即時連線中進行。
它能處理句子間的靜音嗎?
可以,它包含語音活動偵測 (VAD),可過濾非語音音訊並判斷句子結束位置。靜音閾值可在連線設定中調整,因此您可以微調字幕顯示的速度。
Fun-ASR Realtime 的費用是多少?
在 TokenLab 上,Fun-ASR Realtime 價格為 $0.00009 每秒。完整明細見上方價格表。 價格因計費單位、規格和用量而異。請在模型的詳細定價中比較相同條件下的費率;單一費率不代表總價。
Fun-ASR Realtime 應該使用哪一個端點?
請使用 https://api.tokenlab.sh/v1/realtime 進行 Fun-ASR Realtime 的呼叫。下方的請求範例展示了對應的程式碼格式。
Fun-ASR Realtime 支援哪些操作?
Fun-ASR Realtime 支援 語音轉文字。請在上方選擇一項操作以查看其端點與請求範例。
比較 Fun-ASR Realtime
來源
- Model Studio: real-time speech recognition
- Model Studio: speech-to-text models for real-time and file transcription
更新於 2026年10月2日