Chọn Auto, TokenLab Verified hoặc Official cho mỗi yêu cầu, với giá được hiển thị ngay từ đầu.Xem có gì mới

Alibaba: Qwen Flash

Qwen Flash xử lý các tác vụ văn bản hàng ngày với cửa sổ ngữ cảnh lớn. Đây là ứng viên cho việc tóm tắt khối lượng lớn, chuyển đổi nội dung và các trợ lý cần giữ tài liệu nguồn dài trong cuộc hội thoại.
So sánh mô hình
qwen-flash
Sẵn sàngAlibabaTrò chuyện
Đầu vào / Đầu ra
$0.05 / $0.40
Ngữ cảnh
998K
Độ dài đầu ra tối đa
32K
Phương thức
Trò chuyện
Khả năng
Bộ nhớ đệm PromptSuy luận

Về Qwen Flash

Qwen Flash là mô hình văn bản tổng quát nhanh, chi phí thấp của Alibaba trong dòng Qwen, nhắm đến các công việc khối lượng lớn như tóm tắt, viết lại và các trợ lý đơn giản. Nó nằm dưới Qwen Plus và Qwen Max về khả năng và là mô hình nên thử đầu tiên khi khối lượng công việc quan trọng hơn độ sâu. Alibaba liệt kê nó trong số các tên gọi Qwen cũ, với các thế hệ Qwen3 mới hơn được khuyến nghị cho các dự án mới.

Ưu điểm

  • Tóm tắt và định dạng lại lượng lớn văn bản với độ trễ thấp cho mỗi yêu cầu.
  • Giữ một tài liệu nguồn dài sẵn sàng trong cuộc trò chuyện trong khi mô hình tóm tắt hoặc trả lời.
  • Chế độ tư duy tùy chọn cho phép bạn chỉ dành tài nguyên suy luận cho các yêu cầu cần thiết.
  • Bộ nhớ đệm câu lệnh (prompt caching) giúp giảm bớt công việc lặp lại khi một câu lệnh hệ thống dài hoặc tài liệu được sử dụng lại.

Khi nào nên chọn model khác

  • Chỉ nhập văn bản, không gọi công cụ.
  • Độ sâu suy luận và chất lượng viết thấp hơn Qwen Plus và Qwen Max trong các tác vụ phân tích khó.
  • Alibaba liệt kê đây là tên gọi cũ, vì vậy một mô hình Qwen3 hiện tại có thể phù hợp hơn cho bản dựng mới.

Bắt đầu

  1. Tạo API key

    Tạo API key trong Console để dùng cho mọi mô hình trên nền tảng.

  2. Gửi yêu cầu đầu tiên của bạn

    Sao chép ví dụ cho ngôn ngữ của bạn và chạy nó với endpoint.

    Văn bản sang văn bảnResponses API
    POST/v1/responses
    Định dạng API:
    curl https://api.tokenlab.sh/v1/responses \
      -H "Content-Type: application/json" \
      -H "Authorization: Bearer sk-xxx" \
      -d '{
        "model": "qwen-flash",
        "input": "Hello!"
      }'

Giá

Giá TokenLab áp dụng cho Verified, giúp tiết kiệm chi phí trên hầu hết các model. Giá Official là giá niêm yết từ nhà phát triển, áp dụng cho luồng Official ổn định hơn. Auto sẽ tính phí dựa trên luồng thực hiện thành công yêu cầu.

Đầu vào token <= 125K

mỗi 1M token
Giá niêm yết
Đầu vào $0.05 / Đầu ra $0.40 / Đọc bộ nhớ đệm $0.01 / Ghi bộ nhớ đệm $0.0625 / Văn bản Đầu vào $0.05 / Văn bản Đầu ra $0.40
Official
Đầu vào $0.05 / Đầu ra $0.40 / Đọc bộ nhớ đệm $0.01 / Ghi bộ nhớ đệm $0.0625 / Văn bản Đầu vào $0.05 / Văn bản Đầu ra $0.40
Giảm giá
—

Đầu vào token <= 250K

mỗi 1M token
Giá niêm yết
Đầu vào $0.05 / Đầu ra $0.40 / Đọc bộ nhớ đệm $0.01 / Ghi bộ nhớ đệm $0.0625 / Văn bản Đầu vào $0.05 / Văn bản Đầu ra $0.40
Official
Đầu vào $0.05 / Đầu ra $0.40 / Đọc bộ nhớ đệm $0.01 / Ghi bộ nhớ đệm $0.0625 / Văn bản Đầu vào $0.05 / Văn bản Đầu ra $0.40
Giảm giá
—

Đầu vào token <= 1M

mỗi 1M token
Giá niêm yết
Đầu vào $0.25 / Đầu ra $2.00 / Đọc bộ nhớ đệm $0.05 / Ghi bộ nhớ đệm $0.3125 / Văn bản Đầu vào $0.25 / Văn bản Đầu ra $2.00
Official
Đầu vào $0.25 / Đầu ra $2.00 / Đọc bộ nhớ đệm $0.05 / Ghi bộ nhớ đệm $0.3125 / Văn bản Đầu vào $0.25 / Văn bản Đầu ra $2.00
Giảm giá
—
Giá cache của prompt

Đọc bộ nhớ đệm

Giá niêm yết
$0.01
Official
$0.01
Giảm giá
—

Ghi bộ nhớ đệm

Giá niêm yết
$0.0625
Official
$0.0625
Giảm giá
—

Sử dụng & hoạt động

Tỷ lệ thành công là tỷ lệ yêu cầu hoàn tất. Độ trễ là thời gian của một phản hồi đầy đủ; P95 nghĩa là 95% yêu cầu hoàn thành trong khoảng thời gian đó.

Mức sử dụng & tình trạng

24 giờ qua
Yêu cầu
Tỷ lệ thành công
Độ trễ P95
Tổng token
Hiệu năng mô hình
Các chỉ số sẽ xuất hiện sau khi đạt ngưỡng về quyền riêng tư và khối lượng dữ liệu.

Dữ liệu dựa trên các yêu cầu tổng hợp của người dùng, không bao gồm các kiểm tra trạng thái.

Mở trong Console

Mở Qwen Flash trong Console để chỉnh sửa và gửi prompt ngay.

Giúp tôi thử qwen-flash với tin nhắn ngắn tại /v1/responses. Hiển thị phản hồi, độ trễ và chi phí.

Tình huống sử dụng

Phù hợp cho
  • Suy luận
  • Tóm tắt hàng loạt

    Cô đọng hàng ngàn bài báo, bản ghi cuộc gọi hoặc bài đánh giá thành các bản tóm tắt ngắn, với cùng một câu lệnh được áp dụng cho mỗi mục.

  • Chuyển đổi nội dung

    Chuyển đổi văn bản giữa các tông giọng, ngôn ngữ hoặc định dạng, chẳng hạn như biến ghi chú thành email chỉn chu hoặc bảng thành văn xuôi.

  • Trợ lý trò chuyện nhẹ

    Hỗ trợ bot FAQ hoặc trợ lý trong ứng dụng nơi câu trả lời ngắn gọn và thời gian phản hồi quan trọng hơn sự tinh tế.

  • Hỏi đáp tài liệu dài

    Dán một tài liệu hướng dẫn hoặc bộ chính sách dài vào câu lệnh và trả lời các câu hỏi của nhân viên trực tiếp từ đó.

Ví dụ prompt

Viết lại mô tả sản phẩm sau đây bằng giọng điệu thân thiện, tối đa 60 từ và giữ nguyên số hiệu mô hình.

Tóm tắt bản ghi cuộc họp này thành các quyết định, các mục hành động kèm người phụ trách và các câu hỏi chưa được giải quyết.

Chỉ sử dụng văn bản chính sách ở trên, hãy trả lời: nhà thầu có thể yêu cầu hoàn trả chi phí đi lại không? Trích dẫn điều khoản bạn đã sử dụng.

Mô hình này có giá theo điều kiện. Chỉ tổng token hàng tháng không thể tạo ước tính đáng tin cậy; hãy dùng bảng giá chi tiết theo thông số yêu cầu, bộ nhớ đệm và khung giờ áp dụng.

FAQ

Qwen Flash phù hợp nhất cho việc gì?

Các tác vụ văn bản hàng ngày với khối lượng lớn: tóm tắt, viết lại, chuyển đổi kiểu dịch thuật và các trợ lý đơn giản. Đây là tầng nhanh, chi phí thấp của dòng Qwen, vì vậy hãy sử dụng nó khi thông lượng quan trọng và tác vụ không cần suy luận sâu.

Qwen Flash khác Qwen Plus như thế nào?

Flash là tầng định hướng tốc độ và Plus là tầng cân bằng. Plus mang lại khả năng phân tích và viết tốt hơn; Flash hoàn thành các công việc đơn giản nhanh hơn và rẻ hơn. Hãy bắt đầu với Flash và chuyển các tác vụ cụ thể sang Plus nếu câu trả lời chưa đạt yêu cầu.

Qwen Flash có hỗ trợ chế độ tư duy không?

Có. Tư duy có thể được bật cho các yêu cầu cần suy luận từng bước và tắt cho các yêu cầu đơn giản. Tài liệu của Alibaba liệt kê chế độ tư duy được hỗ trợ cho mô hình này.

Qwen Flash có thể nhận hình ảnh hoặc gọi công cụ không?

Không. Đây là mô hình chỉ nhập văn bản, xuất văn bản, không có đầu vào hình ảnh hoặc gọi công cụ. Hãy chọn mô hình thị giác Qwen hoặc dòng khác nếu yêu cầu cần một trong hai tính năng này.

Qwen Flash có phải là lựa chọn tốt cho dự án mới không?

Các đường ống hiện có có thể tiếp tục sử dụng nó và nó vẫn có thể sử dụng cho các công việc ổn định với khối lượng lớn. Đối với bản dựng mới, Alibaba hướng tới các thế hệ Qwen3 mới hơn, vì vậy hãy so sánh nó với Qwen3.8 Flash trước.

Qwen Flash có giá bao nhiêu?

Trên TokenLab, Qwen Flash có giá Đầu vào $0.05 / Đầu ra $0.40 mỗi 1M token. Bảng giá phía trên cho thấy chi tiết đầy đủ. Giá phụ thuộc vào đơn vị tính phí, thông số và mức sử dụng. Hãy so sánh các điều kiện tương đương trong bảng giá chi tiết của mô hình; một mức giá đơn lẻ không quyết định tổng chi phí.

Giới hạn ngữ cảnh và đầu ra của Qwen Flash là bao nhiêu?

Qwen Flash hỗ trợ tối đa 997.952 token ngữ cảnh và trả về tối đa 32.768 token mỗi phản hồi.

Qwen Flash nên dùng endpoint nào?

Dùng https://api.tokenlab.sh/v1/responses làm mặc định cho Qwen Flash. Nếu mô hình hỗ trợ định dạng native của nhà cung cấp, API workbench cũng hiển thị endpoint đó.

Qwen Flash hỗ trợ những thao tác nào?

Qwen Flash hỗ trợ Văn bản sang văn bản. Chọn một thao tác trong API workbench phía trên để xem endpoint và mã ví dụ tương ứng.

So sánh Qwen Flash

Nguồn

Đánh giá ngày 2 thg 10, 2026

Xem thêm từ Qwen

Mô hình liên quan