Chọn Auto, TokenLab Verified hoặc Official cho mỗi yêu cầu, với giá được hiển thị ngay từ đầu.Xem có gì mới

Alibaba: Qwen3.5-Flash

Qwen3.5 Flash là tùy chọn hướng đến hiệu quả cho công việc văn bản có ngữ cảnh dài trong dòng 3.5. Nó có thể hỗ trợ tóm tắt và các bước xử lý tài liệu lặp đi lặp lại, nơi cùng một nguồn dữ liệu lớn cần được tham khảo trong suốt quá trình thực hiện tác vụ.
So sánh mô hình
qwen3.5-flash
Sẵn sàngAlibabaTrò chuyện
Đầu vào / Đầu ra
$0.10 / $0.40
Ngữ cảnh
992K
Độ dài đầu ra tối đa
64K
Phương thức
Trò chuyện
Khả năng
Bộ nhớ đệm Prompt

Về Qwen3.5-Flash

Qwen3.5-Flash là tầng lưu trữ nhẹ hơn trong dòng sản phẩm Qwen3.5 của Alibaba, được xây dựng để xử lý văn bản nhanh hơn và rẻ hơn so với Qwen3.5-Plus. Mô hình này có ngữ cảnh rất lớn và tính năng lưu trữ bộ nhớ đệm (prompt caching), phù hợp cho việc tóm tắt và thực hiện các lượt xử lý lặp lại trên cùng một nguồn dữ liệu lớn. Nó chia sẻ khả năng hỗ trợ ngôn ngữ rộng rãi của dòng sản phẩm này.

Ưu điểm

  • Tính năng lưu trữ bộ nhớ đệm (prompt caching) hỗ trợ việc tham vấn lặp lại một nguồn dữ liệu lớn.
  • Được tinh chỉnh để ưu tiên tốc độ so với tầng Plus.
  • Chia sẻ khả năng hỗ trợ 201 ngôn ngữ của dòng Qwen3.5.
  • Phù hợp cho các bước trong quy trình như tóm tắt hoặc gắn thẻ.

Khi nào nên chọn model khác

  • Qwen3.5-Plus hoạt động tốt hơn trong các tác vụ phân tích khó.
  • Mô hình chỉ xử lý văn bản, vì vậy không thể thay thế cho một mô hình thị giác (vision model).
  • Cũ hơn Qwen3.8-Flash, mô hình vốn cung cấp các kết quả lập trình tác tử (agentic coding).

Bắt đầu

  1. Tạo API key

    Tạo API key trong Console để dùng cho mọi mô hình trên nền tảng.

  2. Gửi yêu cầu đầu tiên của bạn

    Sao chép ví dụ cho ngôn ngữ của bạn và chạy nó với endpoint.

    Văn bản sang văn bảnResponses API
    POST/v1/responses
    Định dạng API:
    curl https://api.tokenlab.sh/v1/responses \
      -H "Content-Type: application/json" \
      -H "Authorization: Bearer sk-xxx" \
      -d '{
        "model": "qwen3.5-flash",
        "input": "Hello!"
      }'

Giá

Giá TokenLab áp dụng cho Verified, giúp tiết kiệm chi phí trên hầu hết các model. Giá Official là giá niêm yết từ nhà phát triển, áp dụng cho luồng Official ổn định hơn. Auto sẽ tính phí dựa trên luồng thực hiện thành công yêu cầu.

Đầu vào token <= 125K

mỗi 1M token
Giá niêm yết
Đầu vào $0.10 / Đầu ra $0.40 / Đọc bộ nhớ đệm $0.01 / Ghi bộ nhớ đệm $0.125 / Văn bản Đầu vào $0.10 / Văn bản Đầu ra $0.40
Official
Đầu vào $0.10 / Đầu ra $0.40 / Đọc bộ nhớ đệm $0.01 / Ghi bộ nhớ đệm $0.125 / Văn bản Đầu vào $0.10 / Văn bản Đầu ra $0.40
Giảm giá
—

Đầu vào token <= 250K

mỗi 1M token
Giá niêm yết
Đầu vào $0.10 / Đầu ra $0.40 / Đọc bộ nhớ đệm $0.01 / Ghi bộ nhớ đệm $0.125 / Văn bản Đầu vào $0.10 / Văn bản Đầu ra $0.40
Official
Đầu vào $0.10 / Đầu ra $0.40 / Đọc bộ nhớ đệm $0.01 / Ghi bộ nhớ đệm $0.125 / Văn bản Đầu vào $0.10 / Văn bản Đầu ra $0.40
Giảm giá
—

Đầu vào token <= 1M

mỗi 1M token
Giá niêm yết
Đầu vào $0.10 / Đầu ra $0.40 / Đọc bộ nhớ đệm $0.01 / Ghi bộ nhớ đệm $0.125 / Văn bản Đầu vào $0.10 / Văn bản Đầu ra $0.40
Official
Đầu vào $0.10 / Đầu ra $0.40 / Đọc bộ nhớ đệm $0.01 / Ghi bộ nhớ đệm $0.125 / Văn bản Đầu vào $0.10 / Văn bản Đầu ra $0.40
Giảm giá
—
Giá cache của prompt

Đọc bộ nhớ đệm

Giá niêm yết
$0.01
Official
$0.01
Giảm giá
—

Ghi bộ nhớ đệm

Giá niêm yết
$0.125
Official
$0.125
Giảm giá
—

Sử dụng & hoạt động

Tỷ lệ thành công là tỷ lệ yêu cầu hoàn tất. Độ trễ là thời gian của một phản hồi đầy đủ; P95 nghĩa là 95% yêu cầu hoàn thành trong khoảng thời gian đó.

Mức sử dụng & tình trạng

24 giờ qua
Yêu cầu
Tỷ lệ thành công
Độ trễ P95
Tổng token
Hiệu năng mô hình
Các chỉ số sẽ xuất hiện sau khi đạt ngưỡng về quyền riêng tư và khối lượng dữ liệu.

Dữ liệu dựa trên các yêu cầu tổng hợp của người dùng, không bao gồm các kiểm tra trạng thái.

Mở trong Console

Mở Qwen3.5-Flash trong Console để chỉnh sửa và gửi prompt ngay.

Giúp tôi thử qwen3.5-flash với tin nhắn ngắn tại /v1/responses. Hiển thị phản hồi, độ trễ và chi phí.

Tình huống sử dụng

  • Tóm tắt hàng loạt

    Cô đọng các báo cáo dài trong quy trình chạy đêm, với cùng một nguồn dữ liệu lớn được lưu trong bộ nhớ đệm xuyên suốt các phần bạn yêu cầu.

  • Gắn thẻ và định tuyến tài liệu

    Gắn nhãn văn bản dài theo chủ đề, mức độ khẩn cấp hoặc chủ sở hữu và trả về kết quả ở định dạng cố định mà mã nguồn hạ nguồn có thể phân tích.

  • Hỏi đáp lặp lại trên một nguồn dữ liệu

    Lưu trữ một tài liệu hướng dẫn hoặc chính sách vào bộ nhớ đệm một lần và đặt nhiều câu hỏi dựa trên đó mà không cần trả phí xử lý lại toàn bộ văn bản sau mỗi lượt.

  • Chỉnh sửa bản nháp

    Sửa ngữ pháp, giọng văn và cấu trúc trong các bản nháp dài mà vẫn giữ nguyên các tuyên bố và số liệu của tác giả.

Ví dụ prompt

Tóm tắt mỗi phần của cuốn sổ tay này trong hai dòng.

Gắn thẻ phiếu yêu cầu này theo lĩnh vực sản phẩm và mức độ khẩn cấp, sau đó trả về định dạng JSON.

Trả lời các câu hỏi về chính sách đã dán; trả lời 'không đề cập' nếu thông tin không có.

Mô hình này có giá theo điều kiện. Chỉ tổng token hàng tháng không thể tạo ước tính đáng tin cậy; hãy dùng bảng giá chi tiết theo thông số yêu cầu, bộ nhớ đệm và khung giờ áp dụng.

FAQ

Qwen3.5-Flash chính xác là gì?

Đây là tầng lưu trữ nhẹ hơn trong dòng sản phẩm Qwen3.5 của Alibaba, hướng tới việc xử lý nhanh các văn bản dài. Nó nằm dưới Qwen3.5-Plus về sức mạnh và dành cho các bước xử lý tài liệu định kỳ, lặp đi lặp lại.

Khi nào tôi nên chọn Flash thay vì Qwen3.5-Plus?

Hãy chọn Flash khi tốc độ và chi phí quan trọng hơn chiều sâu, chẳng hạn như tóm tắt số lượng lớn, gắn thẻ hoặc hỏi đáp trên một nguồn cố định. Hãy chuyển sang Plus khi các câu trả lời cần phân tích kỹ lưỡng hơn trên nhiều đoạn văn bản.

Qwen3.5-Flash có hỗ trợ lưu trữ bộ nhớ đệm (prompt caching) không?

Có. Lưu trữ bộ nhớ đệm giúp ích khi cùng một nguồn dữ liệu dài được gửi đi nhiều lần, như trong các bước xử lý tài liệu lặp lại mà chỉ có câu hỏi thay đổi giữa các lần gọi.

Qwen3.5-Flash có thể đọc hình ảnh không?

Không. Qwen3.5-Flash chỉ xử lý văn bản. Hãy sử dụng Qwen3.8-Flash, Qwen3.7-Plus hoặc Qwen3-VL Plus khi ảnh chụp màn hình, bản quét hoặc biểu đồ là một phần của tác vụ, và gửi văn bản đã trích xuất đến mô hình này.

Có mô hình Flash mới hơn từ Alibaba không?

Có. Qwen3.8-Flash là một mô hình đa phương thức hỗn hợp chuyên gia (mixture-of-experts) mới hơn, nhắm đến lập trình tác tử và công việc tác tử dài hạn. Hãy giữ lại Qwen3.5-Flash cho các quy trình văn bản thuần túy vốn đã hoạt động tốt.

Qwen3.5-Flash có giá bao nhiêu?

Trên TokenLab, Qwen3.5-Flash có giá Đầu vào $0.10 / Đầu ra $0.40 mỗi 1M token. Bảng giá phía trên cho thấy chi tiết đầy đủ. Giá phụ thuộc vào đơn vị tính phí, thông số và mức sử dụng. Hãy so sánh các điều kiện tương đương trong bảng giá chi tiết của mô hình; một mức giá đơn lẻ không quyết định tổng chi phí.

Giới hạn ngữ cảnh và đầu ra của Qwen3.5-Flash là bao nhiêu?

Qwen3.5-Flash hỗ trợ tối đa 991.808 token ngữ cảnh và trả về tối đa 65.536 token mỗi phản hồi.

Qwen3.5-Flash nên dùng endpoint nào?

Dùng https://api.tokenlab.sh/v1/responses làm mặc định cho Qwen3.5-Flash. Nếu mô hình hỗ trợ định dạng native của nhà cung cấp, API workbench cũng hiển thị endpoint đó.

Qwen3.5-Flash hỗ trợ những thao tác nào?

Qwen3.5-Flash hỗ trợ Văn bản sang văn bản. Chọn một thao tác trong API workbench phía trên để xem endpoint và mã ví dụ tương ứng.

So sánh Qwen3.5-Flash

Nguồn

Đánh giá ngày 2 thg 10, 2026

Xem thêm từ Qwen 3 / QwQ

Mô hình liên quan