Alibaba: Fun-ASR Flash 2026-06-15
fun-asr-flash-2026-06-15- Giá
- Từ $0.000035
- Phương thức
- Âm thanh
Về Fun-ASR Flash 2026-06-15
Fun-ASR Flash 2026-06-15 là phiên bản có mốc thời gian của mô hình nhận diện giọng nói Flash do Alibaba phát triển, được Alibaba giới thiệu dưới tên Qwen-Audio-3.0-ASR-Flash. Mô hình này chuyển đổi các tệp âm thanh ngắn thành văn bản thông qua một lệnh gọi HTTP đồng bộ và sử dụng các lượt hội thoại trước đó làm ngữ cảnh để định hướng nhận diện. Việc ghim ID có mốc thời gian giúp giữ cho một quy trình làm việc ở đúng một phiên bản, không giống như tên thay thế không có ngày tháng có thể sẽ được cập nhật.
Ưu điểm
- Chấp nhận các lượt hội thoại trước đó đi kèm với âm thanh, nhờ đó từ vựng từ cuộc thảo luận đang diễn ra sẽ định hướng cho quá trình nhận diện.
- Alibaba liệt kê dấu thời gian ở mức từ và ranh giới câu trong cùng một phản hồi đồng bộ.
- Ngày tháng trong ID giúp ghim một phiên bản phát hành cụ thể, giúp cho các lần chạy lặp lại có thể so sánh được với nhau.
Khi nào nên chọn model khác
- Các đoạn ghi âm được giới hạn ở khoảng năm phút, vì vậy các bản ghi dài cần sử dụng mô hình Fun-ASR bất đồng bộ hoặc mô hình filetrans.
- Mô hình này chỉ xử lý các đoạn ghi âm đã hoàn thành; đối với phụ đề trực tiếp hoặc đọc chính tả, Fun-ASR Realtime là mô hình phát trực tuyến.
Bắt đầu
Tạo API key
Tạo API key trong Console để dùng cho mọi mô hình trên nền tảng.
Gửi yêu cầu đầu tiên của bạn
Sao chép ví dụ cho ngôn ngữ của bạn và chạy nó với endpoint.
Giọng nói sang văn bảnĐiểm cuối TokenLabPOST/v1/audio/transcriptionscurl -X POST "https://api.tokenlab.sh/v1/audio/transcriptions" \ -H "Authorization: Bearer sk-xxx" \ -F file="@audio.mp3" \ -F operation="stt" \ -F response_format="json" \ -F model="fun-asr-flash-2026-06-15" \ -F language="en"
Giá
Giá Official là mức giá công khai của nhà phát triển. Giá TokenLab là số tiền bạn trả cho mô hình này trên TokenLab.
Giọng nói sang văn bản
mỗi giây- Giá niêm yết
- $0.000035
- Official
- $0.000035
- Giảm giá
- —
| Giá niêm yếtmỗi giây | Officialmỗi giây | Giảm giá | |
|---|---|---|---|
| Giọng nói sang văn bản | $0.000035 | $0.000035 | — |
Sử dụng & hoạt động
Tỷ lệ thành công là tỷ lệ yêu cầu hoàn tất. Độ trễ là thời gian của một phản hồi đầy đủ; P95 nghĩa là 95% yêu cầu hoàn thành trong khoảng thời gian đó.
Mức sử dụng & tình trạng
24 giờ qua- Yêu cầu
- Tỷ lệ thành công
- Độ trễ P95
- Tổng token
Dữ liệu dựa trên các yêu cầu tổng hợp của người dùng, không bao gồm các kiểm tra trạng thái.
Mở trong Console
Mở Fun-ASR Flash 2026-06-15 trong Console để chỉnh sửa và gửi prompt ngay.
Giúp tôi thử fun-asr-flash-2026-06-15 với yêu cầu âm thanh ngắn tại /v1/audio/transcriptions. Hiển thị kết quả và chi phí.
Tình huống sử dụng
Ghi chú thoại
Chuyển đổi các ghi chú và tin nhắn đã ghi âm ngắn trong một yêu cầu duy nhất, không cần xếp hàng chờ một tác vụ bất đồng bộ.
Đọc chính tả y tế
Truyền đoạn hội thoại trước đó làm ngữ cảnh để tên thuốc và các thuật ngữ lâm sàng có nhiều khả năng được nhận diện hơn.
Quy trình kiểm thử được ghim phiên bản
Giữ nguyên phiên bản khi so sánh các thay đổi tóm tắt hạ nguồn với cùng một bản ghi.
Ví dụ prompt
Chuyển đổi bản ghi âm phòng khám dài 3 phút này; ngữ cảnh: lượt trước thảo luận về liều lượng metformin.
Chuyển đổi ghi chú thoại của kỹ sư hiện trường về một lỗi PLC và trả về dấu thời gian theo từ.
Chuyển đổi đoạn gọi khách hàng ngắn này, sử dụng các lượt trò chuyện trước đó làm ngữ cảnh.
FAQ
Ngày trong fun-asr-flash-2026-06-15 có ý nghĩa gì?
Nó xác định một bản phát hành cụ thể, ngày 15 tháng 6 năm 2026. Việc gọi ID có ngày tháng giúp quy trình của bạn gắn liền với bản phát hành đó. Alibaba cung cấp mô hình này dưới tên Qwen-Audio-3.0-ASR-Flash.
Một đoạn âm thanh có thể dài bao nhiêu?
Alibaba tài liệu hóa giới hạn khoảng năm phút cho mỗi lần gọi, với các tệp có dung lượng lên đến 2 GB. Đối với các bản ghi dài hơn, hãy sử dụng Fun-ASR hoặc Qwen3 ASR Flash Filetrans, cả hai đều xử lý các tác vụ tệp bất đồng bộ.
Tôi có thể cung cấp ngữ cảnh về cuộc trò chuyện cho mô hình không?
Có. Mô hình sử dụng định dạng tin nhắn kiểu trò chuyện, vì vậy bạn có thể truyền các lượt trước đó trước đoạn âm thanh. Mô hình sử dụng chúng để ưu tiên từ vựng phù hợp với chủ đề, điều này giúp ích với các thuật ngữ chuyên môn.
Mô hình có trả về dấu thời gian không?
Có. Alibaba mô tả dấu thời gian ở mức từ và ranh giới câu trong phản hồi, vì vậy bạn có thể đồng bộ hóa văn bản với âm thanh để làm phụ đề, xem lại hoặc tìm kiếm mà không cần bước đồng bộ hóa riêng.
Fun-ASR Flash 2026-06-15 có giá bao nhiêu?
Trên TokenLab, Fun-ASR Flash 2026-06-15 có giá $0.000035 mỗi giây. Bảng giá phía trên cho thấy chi tiết đầy đủ. Giá phụ thuộc vào đơn vị tính phí, thông số và mức sử dụng. Hãy so sánh các điều kiện tương đương trong bảng giá chi tiết của mô hình; một mức giá đơn lẻ không quyết định tổng chi phí.
Fun-ASR Flash 2026-06-15 nên dùng endpoint nào?
Dùng https://api.tokenlab.sh/v1/audio/transcriptions làm mặc định cho Fun-ASR Flash 2026-06-15. Nếu mô hình hỗ trợ định dạng native của nhà cung cấp, API workbench cũng hiển thị endpoint đó.
Fun-ASR Flash 2026-06-15 hỗ trợ những thao tác nào?
Fun-ASR Flash 2026-06-15 hỗ trợ Giọng nói sang văn bản. Chọn một thao tác trong API workbench phía trên để xem endpoint và mã ví dụ tương ứng.
So sánh Fun-ASR Flash 2026-06-15
Nguồn
- Model Studio: speech-to-text models for real-time and file transcription
- Model Studio: recording file recognition models
Đánh giá ngày 2 thg 10, 2026