Chọn Auto, TokenLab Verified hoặc Official cho mỗi yêu cầu, với giá được hiển thị ngay từ đầu.Xem có gì mới

DeepSeek: DeepSeek V4 Flash

DeepSeek V4 Flash xử lý các cuộc hội thoại văn bản dài và công việc có hỗ trợ công cụ. Ngữ cảnh một triệu token của nó rất hữu ích khi trợ lý cần suy luận trên một bộ sưu tập tài liệu lớn hoặc giữ một cơ sở mã lớn trong tầm nhìn.
So sánh mô hình
deepseek-v4-flash
Sẵn sàngDeepSeekTrò chuyện
Đầu vào / Đầu ra
$0.15 / $0.60
Ngữ cảnh
1M
Ngày phát hành
24 thg 4, 2026
Độ dài đầu ra tối đa
384K
Phương thức
Thị giácTrò chuyện
Khả năng
Sử dụng công cụBộ nhớ đệm PromptSuy luận

Về DeepSeek V4 Flash

DeepSeek V4 Flash là mô hình nhỏ hơn trong thế hệ V4 của DeepSeek, một mô hình ngôn ngữ hỗn hợp chuyên gia (mixture-of-experts) mã nguồn mở với tổng cộng 284 tỷ tham số và 13 tỷ tham số hoạt động. DeepSeek định vị nó cho tốc độ và chi phí phục vụ thấp trong khi vẫn giữ khả năng suy luận gần với V4 Pro. Nó chạy ở chế độ suy luận và không suy luận, gọi công cụ, lưu trữ bộ nhớ đệm prompt và trả lời bằng JSON theo yêu cầu. Đây là một mô hình văn bản.

Ưu điểm

  • DeepSeek báo cáo rằng khả năng suy luận của nó gần tương đương với V4 Pro và nó đáp ứng tốt các tác vụ tác nhân cơ bản, với số lượng tham số hoạt động nhỏ hơn nhiều.
  • Chế độ suy luận có thể được bật cho mỗi yêu cầu với mức độ nỗ lực thấp, cao hoặc tối đa, vì vậy một mô hình có thể bao gồm cả phản hồi nhanh và giải quyết vấn đề chậm hơn.
  • Cửa sổ ngữ cảnh rất dài cho phép trợ lý giữ một cơ sở mã lớn hoặc một bộ sưu tập tài liệu đáng kể trong tầm nhìn xuyên suốt cuộc trò chuyện.
  • Nó hỗ trợ gọi công cụ, xuất dữ liệu JSON có cấu trúc và lưu trữ bộ nhớ đệm prompt, giúp ích cho các vòng lặp tác nhân dài cần gửi lại cùng một hướng dẫn.

Khi nào nên chọn model khác

  • Đây là một mô hình văn bản, vì vậy công việc liên quan đến ảnh chụp màn hình hoặc sơ đồ thuộc về DeepSeek V4.1 Flash hoặc biến thể vision-exp.
  • DeepSeek cho biết V4 Pro dẫn đầu về các tiêu chuẩn lập trình tác nhân và kiến thức thế giới, vì vậy các tác vụ lập trình và nghiên cứu khó nhất sẽ phù hợp với Pro hơn.
  • Trong chế độ suy luận, văn bản suy luận được trả về riêng biệt và phải được truyền lại trong các lượt gọi công cụ sau đó, điều mà mã tác nhân phải xử lý.

Bắt đầu

  1. Tạo API key

    Tạo API key trong Console để dùng cho mọi mô hình trên nền tảng.

  2. Gửi yêu cầu đầu tiên của bạn

    Sao chép ví dụ cho ngôn ngữ của bạn và chạy nó với endpoint.

    Văn bản sang văn bảnResponses API
    POST/v1/responses
    Định dạng API:
    curl https://api.tokenlab.sh/v1/responses \
      -H "Content-Type: application/json" \
      -H "Authorization: Bearer sk-xxx" \
      -d '{
        "model": "deepseek-v4-flash",
        "input": "Hello!"
      }'

Giá

Giá TokenLab áp dụng cho Verified, giúp tiết kiệm chi phí trên hầu hết các model. Giá Official là giá niêm yết từ nhà phát triển, áp dụng cho luồng Official ổn định hơn. Auto sẽ tính phí dựa trên luồng thực hiện thành công yêu cầu.

Khung giờ tính giá · Giờ thấp điểm

mỗi 1M token
Giá niêm yết
Đầu vào $0.15 / Đầu ra $0.60 / Đọc bộ nhớ đệm $0.003
Official
Đầu vào $0.15 / Đầu ra $0.60 / Đọc bộ nhớ đệm $0.003
Giảm giá
—

Khung giờ tính giá · Giờ cao điểm

mỗi 1M token
Giá niêm yết
Đầu vào $0.30 / Đầu ra $1.20 / Đọc bộ nhớ đệm $0.006
Official
Đầu vào $0.30 / Đầu ra $1.20 / Đọc bộ nhớ đệm $0.006
Giảm giá
—
Giá cache của prompt

Đọc bộ nhớ đệm

Giá niêm yết
$0.003
Official
$0.003
Giảm giá
—

Sử dụng & hoạt động

Tỷ lệ thành công là tỷ lệ yêu cầu hoàn tất. Độ trễ là thời gian của một phản hồi đầy đủ; P95 nghĩa là 95% yêu cầu hoàn thành trong khoảng thời gian đó.

Mức sử dụng & tình trạng

24 giờ qua
Yêu cầu
Tỷ lệ thành công
Độ trễ P95
Tổng token
Hiệu năng mô hình
Tỷ lệ thành công 30 ngày
99,5%
Lượt yêu cầu 30 ngày
100+
Hoạt động gần nhất
12 giờ trước

Dữ liệu dựa trên các yêu cầu tổng hợp của người dùng, không bao gồm các kiểm tra trạng thái.

Mở trong Console

Mở DeepSeek V4 Flash trong Console để chỉnh sửa và gửi prompt ngay.

Giúp tôi thử deepseek-v4-flash với tin nhắn ngắn tại /v1/responses. Hiển thị phản hồi, độ trễ và chi phí.

Tình huống sử dụng

Phù hợp cho
  • Suy luận
  • Thị giác
  • Các bước tác nhân khối lượng lớn

    Sử dụng nó cho nhiều quyết định nhỏ bên trong một vòng lặp tác nhân, chẳng hạn như chọn công cụ, đọc kết quả và lập kế hoạch cho lệnh gọi tiếp theo, nơi thời gian phản hồi và chi phí tích lũy.

  • Câu hỏi về toàn bộ kho lưu trữ

    Dán một cơ sở mã lớn hoặc một tập hợp tài liệu vào ngữ cảnh dài và hỏi xem một hành vi được triển khai ở đâu hoặc những tệp nào sẽ bị ảnh hưởng bởi một thay đổi.

  • Trích xuất có cấu trúc

    Chuyển đổi hợp đồng, phiếu hỗ trợ hoặc nhật ký thành JSON tuân theo một lược đồ, với chế độ suy luận tắt để mỗi bản ghi trả về nhanh chóng.

  • Thay thế trực tiếp cho các tên gọi DeepSeek cũ

    Hướng các ứng dụng khách hiện có đã sử dụng tên chat và reasoner đã ngừng hoạt động sang deepseek-v4-flash, sau đó chọn chế độ suy luận hoặc không suy luận cho mỗi yêu cầu.

Ví dụ prompt

Toàn bộ nguồn của dịch vụ thanh toán của chúng tôi như sau. Những mô-đun nào đọc trường trạng thái hóa đơn, và điều gì sẽ xảy ra nếu tôi thêm một trạng thái mới?

Trích xuất mọi ngày gia hạn, thời hạn thông báo và phí hủy từ năm hợp đồng này và trả về một mảng JSON khớp với lược đồ này.

Bạn có thể gọi search_docs và open_ticket. Người dùng báo cáo rằng webhook đã ngừng đến từ hôm qua. Hãy điều tra bằng các công cụ, sau đó tóm tắt nguyên nhân có thể xảy ra.

Mô hình này có giá theo điều kiện. Chỉ tổng token hàng tháng không thể tạo ước tính đáng tin cậy; hãy dùng bảng giá chi tiết theo thông số yêu cầu, bộ nhớ đệm và khung giờ áp dụng.

FAQ

Sự khác biệt giữa DeepSeek V4 Flash và V4 Pro là gì?

Flash là mô hình nhỏ hơn, với 13 tỷ tham số hoạt động so với 49 tỷ của Pro. DeepSeek cho biết Flash suy luận gần như tốt như Pro và tương đương trên các tác vụ tác nhân đơn giản, trong khi Pro mạnh hơn về lập trình tác nhân và kiến thức thế giới. Hãy bắt đầu với Flash và chuyển tác vụ sang Pro khi nó thất bại.

DeepSeek V4 Flash có hỗ trợ chế độ suy luận không?

Có. Bật suy luận trong yêu cầu và chọn mức độ nỗ lực suy luận thấp, cao hoặc tối đa; cao là mặc định. Suy luận đến trong một trường riêng biệt và các cuộc trò chuyện sử dụng công cụ phải gửi lại nó trong mỗi lượt tiếp theo. Tắt suy luận cho các câu trả lời ngắn, nhạy cảm với độ trễ.

DeepSeek V4 Flash có thể đọc hình ảnh không?

Không. Đây là mô hình văn bản: văn bản đi vào và văn bản đi ra. DeepSeek V4.1 Flash và biến thể V4 Flash vision-exp là các mô hình riêng biệt hiểu được hình ảnh, vì vậy hãy sử dụng một trong số đó khi câu lệnh bao gồm ảnh chụp màn hình hoặc sơ đồ.

Ngữ cảnh dài hữu ích cho việc gì?

Nó cho phép một yêu cầu mang theo toàn bộ kho lưu trữ hoặc một tập hợp tài liệu, vì vậy mô hình có thể trả lời nơi một hành vi được triển khai hoặc những tệp nào bị ảnh hưởng bởi một thay đổi mà không cần truy xuất ở giữa. Kết hợp nó với lưu trữ bộ nhớ đệm prompt khi cùng một tài liệu được gửi lặp đi lặp lại.

Điều gì đã xảy ra với các tên deepseek-chat và deepseek-reasoner cũ?

DeepSeek đã ngừng cung cấp chúng vào ngày 24 tháng 7 năm 2026. Trong quá trình chuyển đổi, chúng được ánh xạ tới V4 Flash ở chế độ không suy luận và suy luận. Mã mới nên gọi deepseek-v4-flash và đặt tùy chọn suy luận, thay vì dựa vào các tên riêng biệt cho từng chế độ.

DeepSeek V4 Flash có giá bao nhiêu?

Trên TokenLab, DeepSeek V4 Flash có giá Đầu vào $0.15 / Đầu ra $0.60 mỗi 1M token. Bảng giá phía trên cho thấy chi tiết đầy đủ. Giá phụ thuộc vào đơn vị tính phí, thông số và mức sử dụng. Hãy so sánh các điều kiện tương đương trong bảng giá chi tiết của mô hình; một mức giá đơn lẻ không quyết định tổng chi phí.

Giới hạn ngữ cảnh và đầu ra của DeepSeek V4 Flash là bao nhiêu?

DeepSeek V4 Flash hỗ trợ tối đa 1.000.000 token ngữ cảnh và trả về tối đa 384.000 token mỗi phản hồi.

DeepSeek V4 Flash nên dùng endpoint nào?

Dùng https://api.tokenlab.sh/v1/responses làm mặc định cho DeepSeek V4 Flash. Nếu mô hình hỗ trợ định dạng native của nhà cung cấp, API workbench cũng hiển thị endpoint đó.

DeepSeek V4 Flash hỗ trợ những thao tác nào?

DeepSeek V4 Flash hỗ trợ Văn bản sang văn bản. Chọn một thao tác trong API workbench phía trên để xem endpoint và mã ví dụ tương ứng.

So sánh DeepSeek V4 Flash

Hướng dẫn sử dụng DeepSeek V4 Flash

Nguồn

Đánh giá ngày 2 thg 10, 2026

Xem thêm từ DeepSeek V4

Mô hình liên quan