Chọn Auto, TokenLab Verified hoặc Official cho mỗi yêu cầu, với giá được hiển thị ngay từ đầu.Xem có gì mới

Alibaba: Fun-ASR Realtime

Fun-ASR Realtime tiêu thụ âm thanh đầu vào khi phiên làm việc diễn ra. Nó được thiết kế cho các trải nghiệm phiên âm trực tiếp như phụ đề và nhập liệu bằng giọng nói, nơi việc chờ đợi một bản ghi hoàn chỉnh sẽ làm gián đoạn tương tác.
So sánh mô hình
fun-asr-realtime
Sẵn sàngAlibabaChuyển đổi giọng nói thành văn bảnĐồng bộ
Giá
Từ $0.00009
Phương thức
Âm thanh

Về Fun-ASR Realtime

Fun-ASR Realtime là mô hình nhận diện giọng nói phát trực tuyến của Alibaba: mô hình nhận âm thanh qua một phiên trực tiếp và trả về văn bản khi mọi người đang nói. Đây là biến thể Fun-ASR dành cho phụ đề, đầu vào giọng nói và hỗ trợ trong cuộc gọi, trong trường hợp Fun-ASR dành cho âm thanh đã ghi sẽ buộc người dùng phải đợi cho đến khi bản ghi kết thúc. Alibaba liệt kê các từ khóa ưu tiên (hotwords), dấu thời gian và tiếng Quan Thoại cùng với các phương ngữ như tiếng Quảng Đông và tiếng Tứ Xuyên.

Ưu điểm

  • Truyền trực tuyến văn bản một phần trong khi người nói vẫn đang nói, nhờ đó phụ đề xuất hiện mà không cần đợi bản ghi hoàn chỉnh.
  • Nhận diện tiếng Quan Thoại với độ chính xác cao và một số phương ngữ, bao gồm tiếng Quảng Đông và tiếng Tứ Xuyên, theo tài liệu của Alibaba.
  • Các từ khóa ưu tiên tùy chỉnh giúp định hướng việc nhận diện trực tiếp hướng tới tên và thuật ngữ cụ thể cho sản phẩm của bạn.
  • Dấu thời gian ở cấp độ từ và câu xuất hiện cùng với luồng dữ liệu, giúp việc đồng bộ hóa phụ đề dễ dàng hơn.

Khi nào nên chọn model khác

  • Mô hình cần một phiên WebSocket, đòi hỏi nhiều công sức tích hợp hơn so với việc tải tệp ghi âm lên Fun-ASR.
  • Việc giải mã trực tiếp không thể xem lại phần âm thanh trước đó, vì vậy đối với độ chính xác khi lưu trữ, Fun-ASR dành cho âm thanh đã ghi là lựa chọn an toàn hơn.

Bắt đầu

  1. Tạo API key

    Tạo API key trong Console để dùng cho mọi mô hình trên nền tảng.

  2. Gửi yêu cầu đầu tiên của bạn

    Sao chép ví dụ cho ngôn ngữ của bạn và chạy nó với endpoint.

    Giọng nói sang văn bảnWebSocket
    WS/v1/realtime
    // npm install ws
    import WebSocket from 'ws';
    
    const socket = new WebSocket("wss://api.tokenlab.sh/v1/realtime?model=fun-asr-realtime", {
      headers: { Authorization: "Bearer sk-xxx" }
    });
    
    socket.on('open', () => {
      // Send the input events supported by this model with socket.send(...).
      // https://tokenlab.sh/docs/en/api-reference/realtime/connect
    });
    socket.on('message', (data) => console.log(data.toString()));
    socket.on('error', (error) => console.error(error));
    socket.on('close', (code, reason) => console.log(code, reason.toString()));
    
    // Close the session when finished.
    process.on('SIGINT', () => socket.close());

Giá

Giá Official là mức giá công khai của nhà phát triển. Giá TokenLab là số tiền bạn trả cho mô hình này trên TokenLab.

Thời gian thực / Giọng nói sang văn bản

mỗi giây
Giá niêm yết
$0.00009
Official
$0.00009
Giảm giá
—

Sử dụng & hoạt động

Tỷ lệ thành công là tỷ lệ yêu cầu hoàn tất. Độ trễ là thời gian của một phản hồi đầy đủ; P95 nghĩa là 95% yêu cầu hoàn thành trong khoảng thời gian đó.

Mức sử dụng & tình trạng

24 giờ qua
Yêu cầu
Tỷ lệ thành công
Độ trễ P95
Tổng token
Hiệu năng mô hình
Các chỉ số sẽ xuất hiện sau khi đạt ngưỡng về quyền riêng tư và khối lượng dữ liệu.

Dữ liệu dựa trên các yêu cầu tổng hợp của người dùng, không bao gồm các kiểm tra trạng thái.

Mở trong Console

Mở Fun-ASR Realtime trong Console để chỉnh sửa và gửi prompt ngay.

Giúp tôi thử fun-asr-realtime với yêu cầu âm thanh ngắn tại /v1/realtime. Hiển thị kết quả và chi phí.

Tình huống sử dụng

  • Phụ đề trực tiếp

    Hiển thị phụ đề cho một hội thảo trực tuyến hoặc sự kiện khi người nói đang nói, cập nhật từng câu ngay khi câu đó kết thúc.

  • Nhập liệu bằng giọng nói

    Cho phép người dùng đọc chính tả vào biểu mẫu hoặc ô trò chuyện và thấy các từ của họ xuất hiện khi họ đang nói.

  • Trợ lý hiểu phương ngữ

    Xử lý các yêu cầu bằng giọng nói bằng tiếng Quan Thoại và các phương ngữ vùng miền trong một ứng dụng không thể chờ đợi một bản ghi âm đầy đủ.

Ví dụ prompt

Truyền trực tuyến âm thanh từ micrô cho một buổi ra mắt sản phẩm bằng tiếng Quan Thoại và in phụ đề khi mỗi câu kết thúc.

Chuyển đổi một cuộc gọi khách hàng trực tiếp bằng tiếng Quảng Đông với các từ khóa ưu tiên là 'refund' (hoàn tiền) và 'order number' (số đơn hàng).

Truyền trực tuyến một phiên đào tạo và giữ lại dấu thời gian của từ để cắt đoạn sau đó.

FAQ

Khi nào tôi nên chọn Fun-ASR Realtime thay vì Fun-ASR?

Hãy chọn Realtime khi văn bản phải xuất hiện trong khi âm thanh vẫn đang được nói, chẳng hạn như phụ đề hoặc đọc chính tả. Hãy chọn Fun-ASR dành cho âm thanh đã ghi khi bạn có sẵn một bản ghi hoàn chỉnh và muốn phân đoạn người nói (diarization) hoặc đạt độ chính xác cao để lưu trữ.

Làm thế nào để tôi gửi âm thanh cho mô hình?

Thông qua phiên WebSocket phát trực tuyến, bằng SDK DashScope của Alibaba hoặc giao thức thô. Bạn đẩy các khối âm thanh và nhận lại các sự kiện văn bản được nhận diện khi phiên tiếp tục.

Mô hình có hỗ trợ các phương ngữ không?

Có. Tài liệu thời gian thực của Alibaba liệt kê tiếng Quan Thoại cùng với tiếng Quảng Đông, tiếng Tứ Xuyên và các phương ngữ khác, bên cạnh các từ khóa ưu tiên tùy chỉnh giúp ích cho tên riêng và thuật ngữ sản phẩm. Tiếng nói phương ngữ được nhận diện trong cùng một phiên trực tiếp với tiếng Quan Thoại chuẩn.

Mô hình có xử lý khoảng lặng giữa các câu không?

Có, mô hình bao gồm tính năng phát hiện hoạt động giọng nói (voice activity detection) giúp lọc âm thanh không phải là giọng nói và quyết định vị trí kết thúc của các câu. Ngưỡng khoảng lặng có thể cấu hình được trong cài đặt phiên, vì vậy bạn có thể tinh chỉnh tốc độ hiển thị phụ đề.

Fun-ASR Realtime có giá bao nhiêu?

Trên TokenLab, Fun-ASR Realtime có giá $0.00009 mỗi giây. Bảng giá phía trên cho thấy chi tiết đầy đủ. Giá phụ thuộc vào đơn vị tính phí, thông số và mức sử dụng. Hãy so sánh các điều kiện tương đương trong bảng giá chi tiết của mô hình; một mức giá đơn lẻ không quyết định tổng chi phí.

Fun-ASR Realtime nên dùng endpoint nào?

Dùng https://api.tokenlab.sh/v1/realtime làm mặc định cho Fun-ASR Realtime. Nếu mô hình hỗ trợ định dạng native của nhà cung cấp, API workbench cũng hiển thị endpoint đó.

Fun-ASR Realtime hỗ trợ những thao tác nào?

Fun-ASR Realtime hỗ trợ Giọng nói sang văn bản. Chọn một thao tác trong API workbench phía trên để xem endpoint và mã ví dụ tương ứng.

So sánh Fun-ASR Realtime

Nguồn

Đánh giá ngày 2 thg 10, 2026

Xem thêm từ Fun-ASR

Mô hình liên quan