為每個請求選擇 Auto、TokenLab Verified 或 Official,並預先顯示價格。查看最新動態

DeepSeek: DeepSeek V4 Flash

DeepSeek V4 Flash 可處理長文本對話與工具輔助工作。其百萬級 Token 上下文在助理需要對大量文件進行推理或檢視龐大程式碼庫時非常實用。
比較模型
deepseek-v4-flash
可用DeepSeek對話
輸入 / 輸出
$0.15 / $0.60
上下文
1M
發布日期
2026年4月24日
最大輸出長度
384K
模態
視覺辨識對話
能力
工具使用提示詞快取推理

關於 DeepSeek V4 Flash

DeepSeek V4 Flash 是 DeepSeek V4 世代中的小型模型,這是一個開放權重的混合專家(MoE)語言模型,總參數為 284B,活躍參數為 13B。DeepSeek 將其定位為兼顧速度與低服務成本,同時保持與 V4 Pro 相近的推理能力。它支援思考與非思考模式、工具調用、提示詞快取,並可按要求以 JSON 格式回答。這是一個純文字模型。

適用場景

  • DeepSeek 報告稱,其推理能力與 V4 Pro 非常接近,並且在較小的活躍參數數量下,仍能勝任基本的代理任務。
  • 思考模式可按請求開啟,並可選擇低、高或最大努力程度,因此單一模型即可涵蓋快速回覆與較慢的問題解決需求。
  • 超長上下文視窗讓助手能在對話中同時查看大型程式碼庫或大量文件集合。
  • 它支援工具調用、結構化 JSON 輸出和提示詞快取,這有助於需要重複發送相同指令的長代理迴圈。

其他選擇建議

  • 這是一個純文字模型,因此涉及螢幕截圖或圖表的工作應使用 DeepSeek V4.1 Flash 或 vision-exp 變體。
  • DeepSeek 表示 V4 Pro 在代理程式設計基準測試和世界知識方面處於領先地位,因此最困難的程式設計和研究任務更適合 Pro 版本。
  • 在思考模式下,推理文字會分開返回,且必須在後續的工具調用輪次中傳回,代理程式碼必須處理此邏輯。

入門指南

  1. 建立 API 金鑰

    請至 Console 建立金鑰,即可在平台上使用各類模型。

  2. 發送您的第一個請求

    複製您所選語言的範例,並針對端點執行它。

    文字轉文字Responses API
    POST/v1/responses
    API 格式:
    curl https://api.tokenlab.sh/v1/responses \
      -H "Content-Type: application/json" \
      -H "Authorization: Bearer sk-xxx" \
      -d '{
        "model": "deepseek-v4-flash",
        "input": "Hello!"
      }'

定價

Verified 享有 TokenLab 優惠價,多數模型更划算。Official 採用原廠定價,提供更穩定的服務。Auto 模式將依據實際完成請求的管道進行計費。

計價時段 · 離峰時段

每 1M Token
Official 定價
輸入 $0.15 / 輸出 $0.60 / 快取讀取 $0.003
Official
輸入 $0.15 / 輸出 $0.60 / 快取讀取 $0.003
折扣
—

計價時段 · 尖峰時段

每 1M Token
Official 定價
輸入 $0.30 / 輸出 $1.20 / 快取讀取 $0.006
Official
輸入 $0.30 / 輸出 $1.20 / 快取讀取 $0.006
折扣
—
Prompt 快取價格

快取讀取

Official 定價
$0.003
Official
$0.003
折扣
—

使用量與活動

成功率是請求完成的比例;延遲是一次完整回應所需的時間,P95 表示 95% 的請求在該時間內完成。

用量與可用性

過去 24 小時
請求數
成功率
P95 延遲
總 Token 用量
模型效能
近 30 日成功率
99.5%
近 30 日請求數
100+
最後活動時間
10 小時前

資料基於彙總的使用者請求,不包含狀態檢查。

直接在 Console 裡試

在 Console 中開啟 DeepSeek V4 Flash,並準備好編輯或發送提示詞。

協助我使用 deepseek-v4-flash 透過 /v1/responses 進行對話,並顯示回覆、延遲與成本。

應用情境

適合場景
  • 推理
  • 視覺辨識
  • 高頻代理步驟

    將其用於代理迴圈中的許多小決策,例如選擇工具、讀取結果和規劃下一次調用,這些場景下回應時間和成本會累積。

  • 全儲存庫問題

    將大型程式碼庫或大量文件貼入長上下文中,詢問某個行為是在哪裡實現的,或者修改會影響哪些檔案。

  • 結構化提取

    將合約、工單或日誌轉換為符合架構的 JSON,並關閉思考模式,以便每條記錄都能快速返回。

  • 舊版 DeepSeek 名稱的直接替代品

    將使用已停用的 chat 和 reasoner 名稱的現有客戶端指向 deepseek-v4-flash,然後根據請求選擇思考或非思考模式。

提示詞範例

以下是我們計費服務的完整原始碼。哪些模組讀取了發票狀態欄位?如果我新增一個新狀態,會導致什麼問題?

從這五份合約中提取每個續約日期、通知期和取消費用,並返回一個符合此架構的 JSON 陣列。

您可以調用 search_docs 和 open_ticket。有使用者回報 Webhook 昨天停止接收。請使用這些工具進行調查,並總結可能的原因。

此模型按條件計價,僅憑每月 token 總量無法可靠估算;請按請求規格、快取和適用時段查看詳細定價。

FAQ

DeepSeek V4 Flash 與 V4 Pro 有什麼區別?

Flash 是較小的模型,活躍參數為 13B,而 Pro 為 49B。DeepSeek 表示 Flash 的推理能力幾乎與 Pro 相當,在簡單的代理任務上表現一致,而 Pro 在代理程式設計和世界知識方面更強。建議從 Flash 開始,當任務失敗時再轉移到 Pro。

DeepSeek V4 Flash 是否支援思考模式?

是的。在請求中啟用思考模式,並選擇低、高或最大推理努力程度;預設為高。推理內容會出現在單獨的欄位中,使用工具的對話必須在後續每一輪中將其傳回。對於延遲敏感的簡短回答,請關閉思考模式。

DeepSeek V4 Flash 能讀取圖像嗎?

不能。這是一個純文字模型:輸入文字,輸出文字。DeepSeek V4.1 Flash 和 V4 Flash vision-exp 變體是具備圖像理解能力的獨立模型,因此當提示詞包含螢幕截圖或圖表時,請使用這些模型。

長上下文有什麼用處?

它允許單次請求攜帶整個儲存庫或大量文件,因此模型可以在無需中間檢索的情況下回答行為實現位置或變更影響的檔案。當重複發送相同資料時,可搭配提示詞快取使用。

舊的 deepseek-chat 和 deepseek-reasoner 名稱發生了什麼事?

DeepSeek 於 2026 年 7 月 24 日停用了這些名稱。在過渡期間,它們分別對應 V4 Flash 的非思考和思考模式。新程式碼應調用 deepseek-v4-flash 並設定思考選項,而不是依賴不同的名稱來區分模式。

DeepSeek V4 Flash 的費用是多少?

在 TokenLab 上,DeepSeek V4 Flash 價格為 輸入 $0.15 / 輸出 $0.60 每 1M Token。完整明細見上方價格表。 價格因計費單位、規格和用量而異。請在模型的詳細定價中比較相同條件下的費率;單一費率不代表總價。

DeepSeek V4 Flash 的上下文長度與輸出限制為何?

DeepSeek V4 Flash 支援最高 1,000,000 tokens 的上下文,單次回應上限為 384,000 tokens。

DeepSeek V4 Flash 應該使用哪一個端點?

請使用 https://api.tokenlab.sh/v1/responses 進行 DeepSeek V4 Flash 的呼叫。下方的請求範例展示了對應的程式碼格式。

DeepSeek V4 Flash 支援哪些操作?

DeepSeek V4 Flash 支援 文字轉文字。請在上方選擇一項操作以查看其端點與請求範例。

比較 DeepSeek V4 Flash

使用 DeepSeek V4 Flash 的指南

來源

更新於 2026年10月2日

更多來自 DeepSeek V4 的模型

相關模型