每次请求可选择 Auto、TokenLab Verified 或 Official,并查看对应价格。查看更新

DeepSeek: DeepSeek V4 Flash

DeepSeek V4 Flash 面向长文本对话和工具协作任务。百万 token 上下文适合需要结合大量文档或完整代码背景进行分析的助手。
对比模型
deepseek-v4-flash
可用DeepSeek聊天
输入 / 输出
$0.15 / $0.60
上下文
1M
发布日期
2026年4月24日
最大输出
384K
模态
视觉聊天
能力
工具调用提示词缓存推理

DeepSeek V4 Flash 简介

DeepSeek V4 Flash 是 DeepSeek V4 这一代中较小的模型,是开放权重的混合专家语言模型,总参数 284B,激活参数 13B。DeepSeek 把它定位为速度快、部署成本低,同时推理能力接近 V4 Pro。它有思考和非思考两种模式,支持工具调用、提示词缓存,也可以按要求输出 JSON。它是文本模型。

擅长的任务

  • DeepSeek 称它的推理能力与 V4 Pro 非常接近,在基础智能体任务上表现稳健,而激活参数小得多。
  • 每个请求都可以开启思考,并选择 low、high 或 max 强度,一个模型既能快速回复,也能慢慢解决问题。
  • 超长上下文窗口让助手在一次对话中可以同时看到大型代码库或大量文档。
  • 支持工具调用、结构化 JSON 输出和提示词缓存,对反复发送相同指令的长智能体循环很有帮助。

什么情况换别的模型

  • 它是文本模型,涉及截图或图表的工作应使用 DeepSeek V4.1 Flash 或 vision-exp 版本。
  • DeepSeek 称 V4 Pro 在智能体编程评测和世界知识上领先,最难的编程和研究任务更适合 Pro。
  • 思考模式下,推理文本单独返回,在后续的工具调用回合中必须传回,智能体代码要处理这一点。

快速上手

  1. 创建 API 密钥

    在 Console 生成一把密钥,平台上的模型都能用。

  2. 发送第一个请求

    复制你所用语言的示例代码,向该端点发起请求。

    文本生成Responses API
    POST/v1/responses
    API 格式:
    curl https://api.tokenlab.sh/v1/responses \
      -H "Content-Type: application/json" \
      -H "Authorization: Bearer sk-xxx" \
      -d '{
        "model": "deepseek-v4-flash",
        "input": "Hello!"
      }'

价格

TokenLab 价格用于 Verified,多数模型更便宜;官方价格是模型厂商公布的价格,用于更稳定的 Official。Auto 按最终完成请求的线路计价。

计价时段 · 非峰值时段

每 1M token
官方价格
输入 $0.15 / 输出 $0.60 / 缓存读取 $0.003
Official
输入 $0.15 / 输出 $0.60 / 缓存读取 $0.003
折扣
—

计价时段 · 峰值时段

每 1M token
官方价格
输入 $0.30 / 输出 $1.20 / 缓存读取 $0.006
Official
输入 $0.30 / 输出 $1.20 / 缓存读取 $0.006
折扣
—
提示词缓存价格

缓存读取

官方价格
$0.003
Official
$0.003
折扣
—

用量与动态

成功率是请求完成的比例;延迟是拿到一次完整响应要花的时间,P95 表示 95% 的请求都在这个时间内完成。

用量与可用性

最近 24 小时
请求
成功率
P95 延迟
总 token 数
模型表现
30 天成功率
99.5%
30 天请求数
100+
最后活动时间
16小时前

数据来自汇总的用户请求,不含状态检查。

直接在 Console 里试

DeepSeek V4 Flash 已在 Console 备好,提示词已填好,可以直接修改或发送。

帮我用 deepseek-v4-flash 发一条简短消息,接口是 /v1/responses。返回回复,附上延迟和费用。

使用场景

适用场景
  • 推理
  • 视觉
  • 大批量智能体步骤

    用在智能体循环里大量的小决策上,比如选工具、读取结果、规划下一次调用,这些步骤的响应时间和成本会累积。

  • 整个仓库的问答

    把大型代码库或一堆文档放进长上下文,询问某个行为在哪里实现,或一次改动会涉及哪些文件。

  • 结构化提取

    把合同、工单或日志转成符合模式的 JSON,关闭思考,每条记录都能很快返回。

  • 替换旧的 DeepSeek 名称

    把原先使用已停用的 chat 和 reasoner 名称的客户端改指向 deepseek-v4-flash,再按请求选择思考或非思考模式。

提示词示例

下面是我们计费服务的完整源码。哪些模块读取了发票状态字段?如果我新增一个状态,会破坏什么?

从这五份合同中提取每个续约日期、通知期限和解约费用,按这个模式返回一个 JSON 数组。

你可以调用 search_docs 和 open_ticket。有用户反馈昨天起收不到 webhook 了。用这些工具排查,然后总结可能的原因。

此模型按条件计价,仅凭月度 token 总量无法可靠估算;请按请求规格、缓存和适用时段查看详细定价。

FAQ

DeepSeek V4 Flash 和 V4 Pro 有什么区别?

Flash 是较小的模型,激活参数 13B,Pro 是 49B。DeepSeek 称 Flash 的推理几乎和 Pro 一样好,在简单智能体任务上与它持平,而 Pro 在智能体编程和世界知识上更强。先用 Flash,任务失败时再换 Pro。

DeepSeek V4 Flash 支持思考模式吗?

支持。在请求里开启思考,并选择 low、high 或 max 推理强度,默认是 high。推理内容通过单独的字段返回,使用工具的对话必须在之后每个回合把它传回。简短、对延迟敏感的回答请关闭思考。

DeepSeek V4 Flash 能读图吗?

不能。它是文本模型:输入文本,输出文本。DeepSeek V4.1 Flash 和 V4 Flash vision-exp 是能理解图像的独立模型,提示词里有截图或图表时请用它们。

长上下文有什么用?

一次请求就可以装下整个仓库或一堆文档,模型可以回答某个行为在哪里实现、一次改动涉及哪些文件,中间不需要检索。同样的材料要反复发送时,搭配提示词缓存使用。

原来的 deepseek-chat 和 deepseek-reasoner 名称怎么样了?

DeepSeek 在 2026 年 7 月 24 日停用了它们。过渡期间它们分别映射到 V4 Flash 的非思考和思考模式。新代码应调用 deepseek-v4-flash 并设置思考选项,不要再依赖每种模式各自的名称。

DeepSeek V4 Flash 的费用是多少?

在 TokenLab 上,DeepSeek V4 Flash 的价格为 输入 $0.15 / 输出 $0.60 每 1M token。完整明细见上方价格表。 价格因计费单位、规格和用量而异。请在模型的详细定价中对比相同条件下的费率;单一费率不代表总价。

DeepSeek V4 Flash 的上下文窗口和输出上限是多少?

DeepSeek V4 Flash 最多接收 1,000,000 token 的上下文,单次最多返回 384,000 token。

DeepSeek V4 Flash 应该使用哪个端点?

DeepSeek V4 Flash 使用 https://api.tokenlab.sh/v1/responses。代码写法见下方的请求示例。

DeepSeek V4 Flash 支持哪些操作?

DeepSeek V4 Flash 支持 文本生成。选了操作,上面会显示对应的端点和请求示例。

DeepSeek V4 Flash 对比

用到 DeepSeek V4 Flash 的指南

资料来源

审阅于 2026年10月2日

更多 DeepSeek V4 模型

相关模型