Alibaba: Qwen Flash
qwen-flash- Đầu vào / Đầu ra
- $0.05 / $0.40
- Ngữ cảnh
- 998K
- Độ dài đầu ra tối đa
- 32K
- Phương thức
- Trò chuyện
- Khả năng
- Bộ nhớ đệm PromptSuy luận
Về Qwen Flash
Qwen Flash là mô hình văn bản tổng quát nhanh, chi phí thấp của Alibaba trong dòng Qwen, nhắm đến các công việc khối lượng lớn như tóm tắt, viết lại và các trợ lý đơn giản. Nó nằm dưới Qwen Plus và Qwen Max về khả năng và là mô hình nên thử đầu tiên khi khối lượng công việc quan trọng hơn độ sâu. Alibaba liệt kê nó trong số các tên gọi Qwen cũ, với các thế hệ Qwen3 mới hơn được khuyến nghị cho các dự án mới.
Ưu điểm
- Tóm tắt và định dạng lại lượng lớn văn bản với độ trễ thấp cho mỗi yêu cầu.
- Giữ một tài liệu nguồn dài sẵn sàng trong cuộc trò chuyện trong khi mô hình tóm tắt hoặc trả lời.
- Chế độ tư duy tùy chọn cho phép bạn chỉ dành tài nguyên suy luận cho các yêu cầu cần thiết.
- Bộ nhớ đệm câu lệnh (prompt caching) giúp giảm bớt công việc lặp lại khi một câu lệnh hệ thống dài hoặc tài liệu được sử dụng lại.
Khi nào nên chọn model khác
- Chỉ nhập văn bản, không gọi công cụ.
- Độ sâu suy luận và chất lượng viết thấp hơn Qwen Plus và Qwen Max trong các tác vụ phân tích khó.
- Alibaba liệt kê đây là tên gọi cũ, vì vậy một mô hình Qwen3 hiện tại có thể phù hợp hơn cho bản dựng mới.
Bắt đầu
Tạo API key
Tạo API key trong Console để dùng cho mọi mô hình trên nền tảng.
Gửi yêu cầu đầu tiên của bạn
Sao chép ví dụ cho ngôn ngữ của bạn và chạy nó với endpoint.
Văn bản sang văn bảnResponses APIPOST/v1/responsesĐịnh dạng API:curl https://api.tokenlab.sh/v1/responses \ -H "Content-Type: application/json" \ -H "Authorization: Bearer sk-xxx" \ -d '{ "model": "qwen-flash", "input": "Hello!" }'
Giá
Giá TokenLab áp dụng cho Verified, giúp tiết kiệm chi phí trên hầu hết các model. Giá Official là giá niêm yết từ nhà phát triển, áp dụng cho luồng Official ổn định hơn. Auto sẽ tính phí dựa trên luồng thực hiện thành công yêu cầu.
Đầu vào token <= 125K
mỗi 1M token- Giá niêm yết
- Đầu vào $0.05 / Đầu ra $0.40 / Đọc bộ nhớ đệm $0.01 / Ghi bộ nhớ đệm $0.0625 / Văn bản Đầu vào $0.05 / Văn bản Đầu ra $0.40
- Official
- Đầu vào $0.05 / Đầu ra $0.40 / Đọc bộ nhớ đệm $0.01 / Ghi bộ nhớ đệm $0.0625 / Văn bản Đầu vào $0.05 / Văn bản Đầu ra $0.40
- Giảm giá
- —
Đầu vào token <= 250K
mỗi 1M token- Giá niêm yết
- Đầu vào $0.05 / Đầu ra $0.40 / Đọc bộ nhớ đệm $0.01 / Ghi bộ nhớ đệm $0.0625 / Văn bản Đầu vào $0.05 / Văn bản Đầu ra $0.40
- Official
- Đầu vào $0.05 / Đầu ra $0.40 / Đọc bộ nhớ đệm $0.01 / Ghi bộ nhớ đệm $0.0625 / Văn bản Đầu vào $0.05 / Văn bản Đầu ra $0.40
- Giảm giá
- —
Đầu vào token <= 1M
mỗi 1M token- Giá niêm yết
- Đầu vào $0.25 / Đầu ra $2.00 / Đọc bộ nhớ đệm $0.05 / Ghi bộ nhớ đệm $0.3125 / Văn bản Đầu vào $0.25 / Văn bản Đầu ra $2.00
- Official
- Đầu vào $0.25 / Đầu ra $2.00 / Đọc bộ nhớ đệm $0.05 / Ghi bộ nhớ đệm $0.3125 / Văn bản Đầu vào $0.25 / Văn bản Đầu ra $2.00
- Giảm giá
- —
Đọc bộ nhớ đệm
- Giá niêm yết
- $0.01
- Official
- $0.01
- Giảm giá
- —
Ghi bộ nhớ đệm
- Giá niêm yết
- $0.0625
- Official
- $0.0625
- Giảm giá
- —
| Giá niêm yếtmỗi 1M token | Officialmỗi 1M token | Giảm giá | |
|---|---|---|---|
| Đầu vào token <= 125K | Đầu vào $0.05 / Đầu ra $0.40 / Đọc bộ nhớ đệm $0.01 / Ghi bộ nhớ đệm $0.0625 / Văn bản Đầu vào $0.05 / Văn bản Đầu ra $0.40 | Đầu vào $0.05 / Đầu ra $0.40 / Đọc bộ nhớ đệm $0.01 / Ghi bộ nhớ đệm $0.0625 / Văn bản Đầu vào $0.05 / Văn bản Đầu ra $0.40 | — |
| Đầu vào token <= 250K | Đầu vào $0.05 / Đầu ra $0.40 / Đọc bộ nhớ đệm $0.01 / Ghi bộ nhớ đệm $0.0625 / Văn bản Đầu vào $0.05 / Văn bản Đầu ra $0.40 | Đầu vào $0.05 / Đầu ra $0.40 / Đọc bộ nhớ đệm $0.01 / Ghi bộ nhớ đệm $0.0625 / Văn bản Đầu vào $0.05 / Văn bản Đầu ra $0.40 | — |
| Đầu vào token <= 1M | Đầu vào $0.25 / Đầu ra $2.00 / Đọc bộ nhớ đệm $0.05 / Ghi bộ nhớ đệm $0.3125 / Văn bản Đầu vào $0.25 / Văn bản Đầu ra $2.00 | Đầu vào $0.25 / Đầu ra $2.00 / Đọc bộ nhớ đệm $0.05 / Ghi bộ nhớ đệm $0.3125 / Văn bản Đầu vào $0.25 / Văn bản Đầu ra $2.00 | — |
| Giá cache của prompt | |||
| Đọc bộ nhớ đệm | $0.01 | $0.01 | — |
| Ghi bộ nhớ đệm | $0.0625 | $0.0625 | — |
Sử dụng & hoạt động
Tỷ lệ thành công là tỷ lệ yêu cầu hoàn tất. Độ trễ là thời gian của một phản hồi đầy đủ; P95 nghĩa là 95% yêu cầu hoàn thành trong khoảng thời gian đó.
Mức sử dụng & tình trạng
24 giờ qua- Yêu cầu
- Tỷ lệ thành công
- Độ trễ P95
- Tổng token
Dữ liệu dựa trên các yêu cầu tổng hợp của người dùng, không bao gồm các kiểm tra trạng thái.
Mở trong Console
Mở Qwen Flash trong Console để chỉnh sửa và gửi prompt ngay.
Giúp tôi thử qwen-flash với tin nhắn ngắn tại /v1/responses. Hiển thị phản hồi, độ trễ và chi phí.
Tình huống sử dụng
Phù hợp cho- Suy luận
Tóm tắt hàng loạt
Cô đọng hàng ngàn bài báo, bản ghi cuộc gọi hoặc bài đánh giá thành các bản tóm tắt ngắn, với cùng một câu lệnh được áp dụng cho mỗi mục.
Chuyển đổi nội dung
Chuyển đổi văn bản giữa các tông giọng, ngôn ngữ hoặc định dạng, chẳng hạn như biến ghi chú thành email chỉn chu hoặc bảng thành văn xuôi.
Trợ lý trò chuyện nhẹ
Hỗ trợ bot FAQ hoặc trợ lý trong ứng dụng nơi câu trả lời ngắn gọn và thời gian phản hồi quan trọng hơn sự tinh tế.
Hỏi đáp tài liệu dài
Dán một tài liệu hướng dẫn hoặc bộ chính sách dài vào câu lệnh và trả lời các câu hỏi của nhân viên trực tiếp từ đó.
Ví dụ prompt
Viết lại mô tả sản phẩm sau đây bằng giọng điệu thân thiện, tối đa 60 từ và giữ nguyên số hiệu mô hình.
Tóm tắt bản ghi cuộc họp này thành các quyết định, các mục hành động kèm người phụ trách và các câu hỏi chưa được giải quyết.
Chỉ sử dụng văn bản chính sách ở trên, hãy trả lời: nhà thầu có thể yêu cầu hoàn trả chi phí đi lại không? Trích dẫn điều khoản bạn đã sử dụng.
Mô hình này có giá theo điều kiện. Chỉ tổng token hàng tháng không thể tạo ước tính đáng tin cậy; hãy dùng bảng giá chi tiết theo thông số yêu cầu, bộ nhớ đệm và khung giờ áp dụng.
FAQ
Qwen Flash phù hợp nhất cho việc gì?
Các tác vụ văn bản hàng ngày với khối lượng lớn: tóm tắt, viết lại, chuyển đổi kiểu dịch thuật và các trợ lý đơn giản. Đây là tầng nhanh, chi phí thấp của dòng Qwen, vì vậy hãy sử dụng nó khi thông lượng quan trọng và tác vụ không cần suy luận sâu.
Qwen Flash khác Qwen Plus như thế nào?
Flash là tầng định hướng tốc độ và Plus là tầng cân bằng. Plus mang lại khả năng phân tích và viết tốt hơn; Flash hoàn thành các công việc đơn giản nhanh hơn và rẻ hơn. Hãy bắt đầu với Flash và chuyển các tác vụ cụ thể sang Plus nếu câu trả lời chưa đạt yêu cầu.
Qwen Flash có hỗ trợ chế độ tư duy không?
Có. Tư duy có thể được bật cho các yêu cầu cần suy luận từng bước và tắt cho các yêu cầu đơn giản. Tài liệu của Alibaba liệt kê chế độ tư duy được hỗ trợ cho mô hình này.
Qwen Flash có thể nhận hình ảnh hoặc gọi công cụ không?
Không. Đây là mô hình chỉ nhập văn bản, xuất văn bản, không có đầu vào hình ảnh hoặc gọi công cụ. Hãy chọn mô hình thị giác Qwen hoặc dòng khác nếu yêu cầu cần một trong hai tính năng này.
Qwen Flash có phải là lựa chọn tốt cho dự án mới không?
Các đường ống hiện có có thể tiếp tục sử dụng nó và nó vẫn có thể sử dụng cho các công việc ổn định với khối lượng lớn. Đối với bản dựng mới, Alibaba hướng tới các thế hệ Qwen3 mới hơn, vì vậy hãy so sánh nó với Qwen3.8 Flash trước.
Qwen Flash có giá bao nhiêu?
Trên TokenLab, Qwen Flash có giá Đầu vào $0.05 / Đầu ra $0.40 mỗi 1M token. Bảng giá phía trên cho thấy chi tiết đầy đủ. Giá phụ thuộc vào đơn vị tính phí, thông số và mức sử dụng. Hãy so sánh các điều kiện tương đương trong bảng giá chi tiết của mô hình; một mức giá đơn lẻ không quyết định tổng chi phí.
Giới hạn ngữ cảnh và đầu ra của Qwen Flash là bao nhiêu?
Qwen Flash hỗ trợ tối đa 997.952 token ngữ cảnh và trả về tối đa 32.768 token mỗi phản hồi.
Qwen Flash nên dùng endpoint nào?
Dùng https://api.tokenlab.sh/v1/responses làm mặc định cho Qwen Flash. Nếu mô hình hỗ trợ định dạng native của nhà cung cấp, API workbench cũng hiển thị endpoint đó.
Qwen Flash hỗ trợ những thao tác nào?
Qwen Flash hỗ trợ Văn bản sang văn bản. Chọn một thao tác trong API workbench phía trên để xem endpoint và mã ví dụ tương ứng.
So sánh Qwen Flash
Nguồn
Đánh giá ngày 2 thg 10, 2026