Chọn Auto, TokenLab Verified hoặc Official cho mỗi yêu cầu, với giá được hiển thị ngay từ đầu.Xem có gì mới

Alibaba: Fun-ASR Flash 2026-06-15

Fun-ASR Flash 2026-06-15 là bản phát hành nhận dạng giọng nói có ngày tháng dành cho việc phiên âm tệp âm thanh. Việc ghim phiên bản này rất hữu ích khi quy trình phiên âm cần một lựa chọn mô hình nhất quán qua các lần xử lý lặp lại.
So sánh mô hình
fun-asr-flash-2026-06-15
Sẵn sàngAlibabaChuyển đổi giọng nói thành văn bảnĐồng bộ
Giá
Từ $0.000035
Phương thức
Âm thanh

Về Fun-ASR Flash 2026-06-15

Fun-ASR Flash 2026-06-15 là phiên bản có mốc thời gian của mô hình nhận diện giọng nói Flash do Alibaba phát triển, được Alibaba giới thiệu dưới tên Qwen-Audio-3.0-ASR-Flash. Mô hình này chuyển đổi các tệp âm thanh ngắn thành văn bản thông qua một lệnh gọi HTTP đồng bộ và sử dụng các lượt hội thoại trước đó làm ngữ cảnh để định hướng nhận diện. Việc ghim ID có mốc thời gian giúp giữ cho một quy trình làm việc ở đúng một phiên bản, không giống như tên thay thế không có ngày tháng có thể sẽ được cập nhật.

Ưu điểm

  • Chấp nhận các lượt hội thoại trước đó đi kèm với âm thanh, nhờ đó từ vựng từ cuộc thảo luận đang diễn ra sẽ định hướng cho quá trình nhận diện.
  • Alibaba liệt kê dấu thời gian ở mức từ và ranh giới câu trong cùng một phản hồi đồng bộ.
  • Ngày tháng trong ID giúp ghim một phiên bản phát hành cụ thể, giúp cho các lần chạy lặp lại có thể so sánh được với nhau.

Khi nào nên chọn model khác

  • Các đoạn ghi âm được giới hạn ở khoảng năm phút, vì vậy các bản ghi dài cần sử dụng mô hình Fun-ASR bất đồng bộ hoặc mô hình filetrans.
  • Mô hình này chỉ xử lý các đoạn ghi âm đã hoàn thành; đối với phụ đề trực tiếp hoặc đọc chính tả, Fun-ASR Realtime là mô hình phát trực tuyến.

Bắt đầu

  1. Tạo API key

    Tạo API key trong Console để dùng cho mọi mô hình trên nền tảng.

  2. Gửi yêu cầu đầu tiên của bạn

    Sao chép ví dụ cho ngôn ngữ của bạn và chạy nó với endpoint.

    Giọng nói sang văn bảnĐiểm cuối TokenLab
    POST/v1/audio/transcriptions
    curl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \
      -H "Authorization: Bearer sk-xxx" \
      -F file="@audio.mp3" \
      -F operation="stt" \
      -F response_format="json" \
      -F model="fun-asr-flash-2026-06-15" \
      -F language="en"

Giá

Giá Official là mức giá công khai của nhà phát triển. Giá TokenLab là số tiền bạn trả cho mô hình này trên TokenLab.

Giọng nói sang văn bản

mỗi giây
Giá niêm yết
$0.000035
Official
$0.000035
Giảm giá
—

Sử dụng & hoạt động

Tỷ lệ thành công là tỷ lệ yêu cầu hoàn tất. Độ trễ là thời gian của một phản hồi đầy đủ; P95 nghĩa là 95% yêu cầu hoàn thành trong khoảng thời gian đó.

Mức sử dụng & tình trạng

24 giờ qua
Yêu cầu
Tỷ lệ thành công
Độ trễ P95
Tổng token
Hiệu năng mô hình
Các chỉ số sẽ xuất hiện sau khi đạt ngưỡng về quyền riêng tư và khối lượng dữ liệu.

Dữ liệu dựa trên các yêu cầu tổng hợp của người dùng, không bao gồm các kiểm tra trạng thái.

Mở trong Console

Mở Fun-ASR Flash 2026-06-15 trong Console để chỉnh sửa và gửi prompt ngay.

Giúp tôi thử fun-asr-flash-2026-06-15 với yêu cầu âm thanh ngắn tại /v1/audio/transcriptions. Hiển thị kết quả và chi phí.

Tình huống sử dụng

  • Ghi chú thoại

    Chuyển đổi các ghi chú và tin nhắn đã ghi âm ngắn trong một yêu cầu duy nhất, không cần xếp hàng chờ một tác vụ bất đồng bộ.

  • Đọc chính tả y tế

    Truyền đoạn hội thoại trước đó làm ngữ cảnh để tên thuốc và các thuật ngữ lâm sàng có nhiều khả năng được nhận diện hơn.

  • Quy trình kiểm thử được ghim phiên bản

    Giữ nguyên phiên bản khi so sánh các thay đổi tóm tắt hạ nguồn với cùng một bản ghi.

Ví dụ prompt

Chuyển đổi bản ghi âm phòng khám dài 3 phút này; ngữ cảnh: lượt trước thảo luận về liều lượng metformin.

Chuyển đổi ghi chú thoại của kỹ sư hiện trường về một lỗi PLC và trả về dấu thời gian theo từ.

Chuyển đổi đoạn gọi khách hàng ngắn này, sử dụng các lượt trò chuyện trước đó làm ngữ cảnh.

FAQ

Ngày trong fun-asr-flash-2026-06-15 có ý nghĩa gì?

Nó xác định một bản phát hành cụ thể, ngày 15 tháng 6 năm 2026. Việc gọi ID có ngày tháng giúp quy trình của bạn gắn liền với bản phát hành đó. Alibaba cung cấp mô hình này dưới tên Qwen-Audio-3.0-ASR-Flash.

Một đoạn âm thanh có thể dài bao nhiêu?

Alibaba tài liệu hóa giới hạn khoảng năm phút cho mỗi lần gọi, với các tệp có dung lượng lên đến 2 GB. Đối với các bản ghi dài hơn, hãy sử dụng Fun-ASR hoặc Qwen3 ASR Flash Filetrans, cả hai đều xử lý các tác vụ tệp bất đồng bộ.

Tôi có thể cung cấp ngữ cảnh về cuộc trò chuyện cho mô hình không?

Có. Mô hình sử dụng định dạng tin nhắn kiểu trò chuyện, vì vậy bạn có thể truyền các lượt trước đó trước đoạn âm thanh. Mô hình sử dụng chúng để ưu tiên từ vựng phù hợp với chủ đề, điều này giúp ích với các thuật ngữ chuyên môn.

Mô hình có trả về dấu thời gian không?

Có. Alibaba mô tả dấu thời gian ở mức từ và ranh giới câu trong phản hồi, vì vậy bạn có thể đồng bộ hóa văn bản với âm thanh để làm phụ đề, xem lại hoặc tìm kiếm mà không cần bước đồng bộ hóa riêng.

Fun-ASR Flash 2026-06-15 có giá bao nhiêu?

Trên TokenLab, Fun-ASR Flash 2026-06-15 có giá $0.000035 mỗi giây. Bảng giá phía trên cho thấy chi tiết đầy đủ. Giá phụ thuộc vào đơn vị tính phí, thông số và mức sử dụng. Hãy so sánh các điều kiện tương đương trong bảng giá chi tiết của mô hình; một mức giá đơn lẻ không quyết định tổng chi phí.

Fun-ASR Flash 2026-06-15 nên dùng endpoint nào?

Dùng https://api.tokenlab.sh/v1/audio/transcriptions làm mặc định cho Fun-ASR Flash 2026-06-15. Nếu mô hình hỗ trợ định dạng native của nhà cung cấp, API workbench cũng hiển thị endpoint đó.

Fun-ASR Flash 2026-06-15 hỗ trợ những thao tác nào?

Fun-ASR Flash 2026-06-15 hỗ trợ Giọng nói sang văn bản. Chọn một thao tác trong API workbench phía trên để xem endpoint và mã ví dụ tương ứng.

So sánh Fun-ASR Flash 2026-06-15

Nguồn

Đánh giá ngày 2 thg 10, 2026

Xem thêm từ Fun-ASR

Mô hình liên quan