Alibaba: Fun-ASR Realtime
fun-asr-realtime- Giá
- Từ $0.00009
- Phương thức
- Âm thanh
Về Fun-ASR Realtime
Fun-ASR Realtime là mô hình nhận diện giọng nói phát trực tuyến của Alibaba: mô hình nhận âm thanh qua một phiên trực tiếp và trả về văn bản khi mọi người đang nói. Đây là biến thể Fun-ASR dành cho phụ đề, đầu vào giọng nói và hỗ trợ trong cuộc gọi, trong trường hợp Fun-ASR dành cho âm thanh đã ghi sẽ buộc người dùng phải đợi cho đến khi bản ghi kết thúc. Alibaba liệt kê các từ khóa ưu tiên (hotwords), dấu thời gian và tiếng Quan Thoại cùng với các phương ngữ như tiếng Quảng Đông và tiếng Tứ Xuyên.
Ưu điểm
- Truyền trực tuyến văn bản một phần trong khi người nói vẫn đang nói, nhờ đó phụ đề xuất hiện mà không cần đợi bản ghi hoàn chỉnh.
- Nhận diện tiếng Quan Thoại với độ chính xác cao và một số phương ngữ, bao gồm tiếng Quảng Đông và tiếng Tứ Xuyên, theo tài liệu của Alibaba.
- Các từ khóa ưu tiên tùy chỉnh giúp định hướng việc nhận diện trực tiếp hướng tới tên và thuật ngữ cụ thể cho sản phẩm của bạn.
- Dấu thời gian ở cấp độ từ và câu xuất hiện cùng với luồng dữ liệu, giúp việc đồng bộ hóa phụ đề dễ dàng hơn.
Khi nào nên chọn model khác
- Mô hình cần một phiên WebSocket, đòi hỏi nhiều công sức tích hợp hơn so với việc tải tệp ghi âm lên Fun-ASR.
- Việc giải mã trực tiếp không thể xem lại phần âm thanh trước đó, vì vậy đối với độ chính xác khi lưu trữ, Fun-ASR dành cho âm thanh đã ghi là lựa chọn an toàn hơn.
Bắt đầu
Tạo API key
Tạo API key trong Console để dùng cho mọi mô hình trên nền tảng.
Gửi yêu cầu đầu tiên của bạn
Sao chép ví dụ cho ngôn ngữ của bạn và chạy nó với endpoint.
Giọng nói sang văn bảnWebSocketWS/v1/realtime// npm install ws import WebSocket from 'ws'; const socket = new WebSocket("wss://api.tokenlab.sh/v1/realtime?model=fun-asr-realtime", { headers: { Authorization: "Bearer sk-xxx" } }); socket.on('open', () => { // Send the input events supported by this model with socket.send(...). // https://tokenlab.sh/docs/en/api-reference/realtime/connect }); socket.on('message', (data) => console.log(data.toString())); socket.on('error', (error) => console.error(error)); socket.on('close', (code, reason) => console.log(code, reason.toString())); // Close the session when finished. process.on('SIGINT', () => socket.close());
Giá
Giá Official là mức giá công khai của nhà phát triển. Giá TokenLab là số tiền bạn trả cho mô hình này trên TokenLab.
Thời gian thực / Giọng nói sang văn bản
mỗi giây- Giá niêm yết
- $0.00009
- Official
- $0.00009
- Giảm giá
- —
| Giá niêm yếtmỗi giây | Officialmỗi giây | Giảm giá | |
|---|---|---|---|
| Thời gian thực / Giọng nói sang văn bản | $0.00009 | $0.00009 | — |
Sử dụng & hoạt động
Tỷ lệ thành công là tỷ lệ yêu cầu hoàn tất. Độ trễ là thời gian của một phản hồi đầy đủ; P95 nghĩa là 95% yêu cầu hoàn thành trong khoảng thời gian đó.
Mức sử dụng & tình trạng
24 giờ qua- Yêu cầu
- Tỷ lệ thành công
- Độ trễ P95
- Tổng token
Dữ liệu dựa trên các yêu cầu tổng hợp của người dùng, không bao gồm các kiểm tra trạng thái.
Mở trong Console
Mở Fun-ASR Realtime trong Console để chỉnh sửa và gửi prompt ngay.
Giúp tôi thử fun-asr-realtime với yêu cầu âm thanh ngắn tại /v1/realtime. Hiển thị kết quả và chi phí.
Tình huống sử dụng
Phụ đề trực tiếp
Hiển thị phụ đề cho một hội thảo trực tuyến hoặc sự kiện khi người nói đang nói, cập nhật từng câu ngay khi câu đó kết thúc.
Nhập liệu bằng giọng nói
Cho phép người dùng đọc chính tả vào biểu mẫu hoặc ô trò chuyện và thấy các từ của họ xuất hiện khi họ đang nói.
Trợ lý hiểu phương ngữ
Xử lý các yêu cầu bằng giọng nói bằng tiếng Quan Thoại và các phương ngữ vùng miền trong một ứng dụng không thể chờ đợi một bản ghi âm đầy đủ.
Ví dụ prompt
Truyền trực tuyến âm thanh từ micrô cho một buổi ra mắt sản phẩm bằng tiếng Quan Thoại và in phụ đề khi mỗi câu kết thúc.
Chuyển đổi một cuộc gọi khách hàng trực tiếp bằng tiếng Quảng Đông với các từ khóa ưu tiên là 'refund' (hoàn tiền) và 'order number' (số đơn hàng).
Truyền trực tuyến một phiên đào tạo và giữ lại dấu thời gian của từ để cắt đoạn sau đó.
FAQ
Khi nào tôi nên chọn Fun-ASR Realtime thay vì Fun-ASR?
Hãy chọn Realtime khi văn bản phải xuất hiện trong khi âm thanh vẫn đang được nói, chẳng hạn như phụ đề hoặc đọc chính tả. Hãy chọn Fun-ASR dành cho âm thanh đã ghi khi bạn có sẵn một bản ghi hoàn chỉnh và muốn phân đoạn người nói (diarization) hoặc đạt độ chính xác cao để lưu trữ.
Làm thế nào để tôi gửi âm thanh cho mô hình?
Thông qua phiên WebSocket phát trực tuyến, bằng SDK DashScope của Alibaba hoặc giao thức thô. Bạn đẩy các khối âm thanh và nhận lại các sự kiện văn bản được nhận diện khi phiên tiếp tục.
Mô hình có hỗ trợ các phương ngữ không?
Có. Tài liệu thời gian thực của Alibaba liệt kê tiếng Quan Thoại cùng với tiếng Quảng Đông, tiếng Tứ Xuyên và các phương ngữ khác, bên cạnh các từ khóa ưu tiên tùy chỉnh giúp ích cho tên riêng và thuật ngữ sản phẩm. Tiếng nói phương ngữ được nhận diện trong cùng một phiên trực tiếp với tiếng Quan Thoại chuẩn.
Mô hình có xử lý khoảng lặng giữa các câu không?
Có, mô hình bao gồm tính năng phát hiện hoạt động giọng nói (voice activity detection) giúp lọc âm thanh không phải là giọng nói và quyết định vị trí kết thúc của các câu. Ngưỡng khoảng lặng có thể cấu hình được trong cài đặt phiên, vì vậy bạn có thể tinh chỉnh tốc độ hiển thị phụ đề.
Fun-ASR Realtime có giá bao nhiêu?
Trên TokenLab, Fun-ASR Realtime có giá $0.00009 mỗi giây. Bảng giá phía trên cho thấy chi tiết đầy đủ. Giá phụ thuộc vào đơn vị tính phí, thông số và mức sử dụng. Hãy so sánh các điều kiện tương đương trong bảng giá chi tiết của mô hình; một mức giá đơn lẻ không quyết định tổng chi phí.
Fun-ASR Realtime nên dùng endpoint nào?
Dùng https://api.tokenlab.sh/v1/realtime làm mặc định cho Fun-ASR Realtime. Nếu mô hình hỗ trợ định dạng native của nhà cung cấp, API workbench cũng hiển thị endpoint đó.
Fun-ASR Realtime hỗ trợ những thao tác nào?
Fun-ASR Realtime hỗ trợ Giọng nói sang văn bản. Chọn một thao tác trong API workbench phía trên để xem endpoint và mã ví dụ tương ứng.
So sánh Fun-ASR Realtime
Nguồn
- Model Studio: real-time speech recognition
- Model Studio: speech-to-text models for real-time and file transcription
Đánh giá ngày 2 thg 10, 2026