Alibaba: Qwen3.5-Flash
qwen3.5-flash- Đầu vào / Đầu ra
- $0.10 / $0.40
- Ngữ cảnh
- 992K
- Độ dài đầu ra tối đa
- 64K
- Phương thức
- Trò chuyện
- Khả năng
- Bộ nhớ đệm Prompt
Về Qwen3.5-Flash
Qwen3.5-Flash là tầng lưu trữ nhẹ hơn trong dòng sản phẩm Qwen3.5 của Alibaba, được xây dựng để xử lý văn bản nhanh hơn và rẻ hơn so với Qwen3.5-Plus. Mô hình này có ngữ cảnh rất lớn và tính năng lưu trữ bộ nhớ đệm (prompt caching), phù hợp cho việc tóm tắt và thực hiện các lượt xử lý lặp lại trên cùng một nguồn dữ liệu lớn. Nó chia sẻ khả năng hỗ trợ ngôn ngữ rộng rãi của dòng sản phẩm này.
Ưu điểm
- Tính năng lưu trữ bộ nhớ đệm (prompt caching) hỗ trợ việc tham vấn lặp lại một nguồn dữ liệu lớn.
- Được tinh chỉnh để ưu tiên tốc độ so với tầng Plus.
- Chia sẻ khả năng hỗ trợ 201 ngôn ngữ của dòng Qwen3.5.
- Phù hợp cho các bước trong quy trình như tóm tắt hoặc gắn thẻ.
Khi nào nên chọn model khác
- Qwen3.5-Plus hoạt động tốt hơn trong các tác vụ phân tích khó.
- Mô hình chỉ xử lý văn bản, vì vậy không thể thay thế cho một mô hình thị giác (vision model).
- Cũ hơn Qwen3.8-Flash, mô hình vốn cung cấp các kết quả lập trình tác tử (agentic coding).
Bắt đầu
Tạo API key
Tạo API key trong Console để dùng cho mọi mô hình trên nền tảng.
Gửi yêu cầu đầu tiên của bạn
Sao chép ví dụ cho ngôn ngữ của bạn và chạy nó với endpoint.
Văn bản sang văn bảnResponses APIPOST/v1/responsesĐịnh dạng API:curl https://api.tokenlab.sh/v1/responses \ -H "Content-Type: application/json" \ -H "Authorization: Bearer sk-xxx" \ -d '{ "model": "qwen3.5-flash", "input": "Hello!" }'
Giá
Giá TokenLab áp dụng cho Verified, giúp tiết kiệm chi phí trên hầu hết các model. Giá Official là giá niêm yết từ nhà phát triển, áp dụng cho luồng Official ổn định hơn. Auto sẽ tính phí dựa trên luồng thực hiện thành công yêu cầu.
Đầu vào token <= 125K
mỗi 1M token- Giá niêm yết
- Đầu vào $0.10 / Đầu ra $0.40 / Đọc bộ nhớ đệm $0.01 / Ghi bộ nhớ đệm $0.125 / Văn bản Đầu vào $0.10 / Văn bản Đầu ra $0.40
- Official
- Đầu vào $0.10 / Đầu ra $0.40 / Đọc bộ nhớ đệm $0.01 / Ghi bộ nhớ đệm $0.125 / Văn bản Đầu vào $0.10 / Văn bản Đầu ra $0.40
- Giảm giá
- —
Đầu vào token <= 250K
mỗi 1M token- Giá niêm yết
- Đầu vào $0.10 / Đầu ra $0.40 / Đọc bộ nhớ đệm $0.01 / Ghi bộ nhớ đệm $0.125 / Văn bản Đầu vào $0.10 / Văn bản Đầu ra $0.40
- Official
- Đầu vào $0.10 / Đầu ra $0.40 / Đọc bộ nhớ đệm $0.01 / Ghi bộ nhớ đệm $0.125 / Văn bản Đầu vào $0.10 / Văn bản Đầu ra $0.40
- Giảm giá
- —
Đầu vào token <= 1M
mỗi 1M token- Giá niêm yết
- Đầu vào $0.10 / Đầu ra $0.40 / Đọc bộ nhớ đệm $0.01 / Ghi bộ nhớ đệm $0.125 / Văn bản Đầu vào $0.10 / Văn bản Đầu ra $0.40
- Official
- Đầu vào $0.10 / Đầu ra $0.40 / Đọc bộ nhớ đệm $0.01 / Ghi bộ nhớ đệm $0.125 / Văn bản Đầu vào $0.10 / Văn bản Đầu ra $0.40
- Giảm giá
- —
Đọc bộ nhớ đệm
- Giá niêm yết
- $0.01
- Official
- $0.01
- Giảm giá
- —
Ghi bộ nhớ đệm
- Giá niêm yết
- $0.125
- Official
- $0.125
- Giảm giá
- —
| Giá niêm yếtmỗi 1M token | Officialmỗi 1M token | Giảm giá | |
|---|---|---|---|
| Đầu vào token <= 125K | Đầu vào $0.10 / Đầu ra $0.40 / Đọc bộ nhớ đệm $0.01 / Ghi bộ nhớ đệm $0.125 / Văn bản Đầu vào $0.10 / Văn bản Đầu ra $0.40 | Đầu vào $0.10 / Đầu ra $0.40 / Đọc bộ nhớ đệm $0.01 / Ghi bộ nhớ đệm $0.125 / Văn bản Đầu vào $0.10 / Văn bản Đầu ra $0.40 | — |
| Đầu vào token <= 250K | Đầu vào $0.10 / Đầu ra $0.40 / Đọc bộ nhớ đệm $0.01 / Ghi bộ nhớ đệm $0.125 / Văn bản Đầu vào $0.10 / Văn bản Đầu ra $0.40 | Đầu vào $0.10 / Đầu ra $0.40 / Đọc bộ nhớ đệm $0.01 / Ghi bộ nhớ đệm $0.125 / Văn bản Đầu vào $0.10 / Văn bản Đầu ra $0.40 | — |
| Đầu vào token <= 1M | Đầu vào $0.10 / Đầu ra $0.40 / Đọc bộ nhớ đệm $0.01 / Ghi bộ nhớ đệm $0.125 / Văn bản Đầu vào $0.10 / Văn bản Đầu ra $0.40 | Đầu vào $0.10 / Đầu ra $0.40 / Đọc bộ nhớ đệm $0.01 / Ghi bộ nhớ đệm $0.125 / Văn bản Đầu vào $0.10 / Văn bản Đầu ra $0.40 | — |
| Giá cache của prompt | |||
| Đọc bộ nhớ đệm | $0.01 | $0.01 | — |
| Ghi bộ nhớ đệm | $0.125 | $0.125 | — |
Sử dụng & hoạt động
Tỷ lệ thành công là tỷ lệ yêu cầu hoàn tất. Độ trễ là thời gian của một phản hồi đầy đủ; P95 nghĩa là 95% yêu cầu hoàn thành trong khoảng thời gian đó.
Mức sử dụng & tình trạng
24 giờ qua- Yêu cầu
- Tỷ lệ thành công
- Độ trễ P95
- Tổng token
Dữ liệu dựa trên các yêu cầu tổng hợp của người dùng, không bao gồm các kiểm tra trạng thái.
Mở trong Console
Mở Qwen3.5-Flash trong Console để chỉnh sửa và gửi prompt ngay.
Giúp tôi thử qwen3.5-flash với tin nhắn ngắn tại /v1/responses. Hiển thị phản hồi, độ trễ và chi phí.
Tình huống sử dụng
Tóm tắt hàng loạt
Cô đọng các báo cáo dài trong quy trình chạy đêm, với cùng một nguồn dữ liệu lớn được lưu trong bộ nhớ đệm xuyên suốt các phần bạn yêu cầu.
Gắn thẻ và định tuyến tài liệu
Gắn nhãn văn bản dài theo chủ đề, mức độ khẩn cấp hoặc chủ sở hữu và trả về kết quả ở định dạng cố định mà mã nguồn hạ nguồn có thể phân tích.
Hỏi đáp lặp lại trên một nguồn dữ liệu
Lưu trữ một tài liệu hướng dẫn hoặc chính sách vào bộ nhớ đệm một lần và đặt nhiều câu hỏi dựa trên đó mà không cần trả phí xử lý lại toàn bộ văn bản sau mỗi lượt.
Chỉnh sửa bản nháp
Sửa ngữ pháp, giọng văn và cấu trúc trong các bản nháp dài mà vẫn giữ nguyên các tuyên bố và số liệu của tác giả.
Ví dụ prompt
Tóm tắt mỗi phần của cuốn sổ tay này trong hai dòng.
Gắn thẻ phiếu yêu cầu này theo lĩnh vực sản phẩm và mức độ khẩn cấp, sau đó trả về định dạng JSON.
Trả lời các câu hỏi về chính sách đã dán; trả lời 'không đề cập' nếu thông tin không có.
Mô hình này có giá theo điều kiện. Chỉ tổng token hàng tháng không thể tạo ước tính đáng tin cậy; hãy dùng bảng giá chi tiết theo thông số yêu cầu, bộ nhớ đệm và khung giờ áp dụng.
FAQ
Qwen3.5-Flash chính xác là gì?
Đây là tầng lưu trữ nhẹ hơn trong dòng sản phẩm Qwen3.5 của Alibaba, hướng tới việc xử lý nhanh các văn bản dài. Nó nằm dưới Qwen3.5-Plus về sức mạnh và dành cho các bước xử lý tài liệu định kỳ, lặp đi lặp lại.
Khi nào tôi nên chọn Flash thay vì Qwen3.5-Plus?
Hãy chọn Flash khi tốc độ và chi phí quan trọng hơn chiều sâu, chẳng hạn như tóm tắt số lượng lớn, gắn thẻ hoặc hỏi đáp trên một nguồn cố định. Hãy chuyển sang Plus khi các câu trả lời cần phân tích kỹ lưỡng hơn trên nhiều đoạn văn bản.
Qwen3.5-Flash có hỗ trợ lưu trữ bộ nhớ đệm (prompt caching) không?
Có. Lưu trữ bộ nhớ đệm giúp ích khi cùng một nguồn dữ liệu dài được gửi đi nhiều lần, như trong các bước xử lý tài liệu lặp lại mà chỉ có câu hỏi thay đổi giữa các lần gọi.
Qwen3.5-Flash có thể đọc hình ảnh không?
Không. Qwen3.5-Flash chỉ xử lý văn bản. Hãy sử dụng Qwen3.8-Flash, Qwen3.7-Plus hoặc Qwen3-VL Plus khi ảnh chụp màn hình, bản quét hoặc biểu đồ là một phần của tác vụ, và gửi văn bản đã trích xuất đến mô hình này.
Có mô hình Flash mới hơn từ Alibaba không?
Có. Qwen3.8-Flash là một mô hình đa phương thức hỗn hợp chuyên gia (mixture-of-experts) mới hơn, nhắm đến lập trình tác tử và công việc tác tử dài hạn. Hãy giữ lại Qwen3.5-Flash cho các quy trình văn bản thuần túy vốn đã hoạt động tốt.
Qwen3.5-Flash có giá bao nhiêu?
Trên TokenLab, Qwen3.5-Flash có giá Đầu vào $0.10 / Đầu ra $0.40 mỗi 1M token. Bảng giá phía trên cho thấy chi tiết đầy đủ. Giá phụ thuộc vào đơn vị tính phí, thông số và mức sử dụng. Hãy so sánh các điều kiện tương đương trong bảng giá chi tiết của mô hình; một mức giá đơn lẻ không quyết định tổng chi phí.
Giới hạn ngữ cảnh và đầu ra của Qwen3.5-Flash là bao nhiêu?
Qwen3.5-Flash hỗ trợ tối đa 991.808 token ngữ cảnh và trả về tối đa 65.536 token mỗi phản hồi.
Qwen3.5-Flash nên dùng endpoint nào?
Dùng https://api.tokenlab.sh/v1/responses làm mặc định cho Qwen3.5-Flash. Nếu mô hình hỗ trợ định dạng native của nhà cung cấp, API workbench cũng hiển thị endpoint đó.
Qwen3.5-Flash hỗ trợ những thao tác nào?
Qwen3.5-Flash hỗ trợ Văn bản sang văn bản. Chọn một thao tác trong API workbench phía trên để xem endpoint và mã ví dụ tương ứng.
So sánh Qwen3.5-Flash
Nguồn
Đánh giá ngày 2 thg 10, 2026