DeepSeek V4 Flash 0731 图文解读

为什么一个每次只激活 13B 参数的模型,能把 Agent 性能和价格同时打下来


先别看参数,先看价格

DeepSeek 在 2026 年 7 月 31 日把 DeepSeek-V4-Flash-0731 推到 API 公测。真正让人第一眼停下来的,是它把百万 Token 的价格压到了人民币个位数。

图 1|按 DeepSeek 中英文官方定价页整理。人民币与美元均为官方列价,并非实时汇率换算。

把数字换成一次真实任务:输入 10 万 Token 的代码和文档,再输出 1 万 Token 的分析结果,按缓存未命中的常规定价计算,大约只要 0.12 元人民币,约 0.0168 美元。即使后续峰时价格按官方预告翻倍,仍然是几毛钱级别。

一句话判断:V4 Flash 的意义不是"聊天更便宜",而是让长时间运行的编程 Agent、搜索 Agent 和自动化工作流第一次拥有非常低的边际推理成本。

0731 版本究竟更新了什么

这次不是重新训练了一个更大的底座。官方更新日志写得很明确:0731 与 V4 Flash Preview 使用相同的模型架构和规模,主要变化是重新进行了后训练,并强化了 Agent 能力。也就是说,硬件账单没有突然变大,但模型学会了更稳定地使用终端、代码仓库和外部工具。

图 2|0731 与 Preview 的官方 Agent 基准对比。DSBench 属于官方内部测试,公共基准也使用了指定 Harness 与 max 推理强度。

最夸张的是 DeepSWE,从 7.3 跳到 54.4;Terminal Bench 2.1 从 61.8 提升到 82.7;CyberGym 从 38.7 提升到 76.7。它甚至在官方列出的多项测试中超过了参数更大的 V4-Pro Preview。

但这里必须保持清醒:这些结果来自官方测试配置,部分 Harness 尚未发布,而且 DSBench-FullStack 与 DSBench-Hard 是内部数据集。它说明模型进步很大,不等于任何业务场景都能直接复现同样的提升。

为什么它能又便宜又强

第一层答案是 MoE。V4 Flash 总参数约 284B,但每个 Token 只激活约 13B。可以把它理解成一家拥有大量专业员工的公司:遇到代码问题就叫代码专家上班,遇到数学问题再换另一组专家,而不是每次让全公司一起开会。总知识容量很大,单次计算量却被控制住。

图 3|DeepSeek-V4 官方总体架构:CSA/HCA 混合注意力、DeepSeekMoE、mHC 与 MTP。来源:官方技术报告 Figure 2。

第二层答案是它不再粗暴地"看完全部历史"。Agent 连续执行几十次工具调用后,最贵的往往不是生成新文字,而是每生成一个 Token 都要重新翻阅前面巨大的上下文。V4 用 CSA 和 HCA 两种注意力交替处理历史信息。

CSA 先压缩,再挑重点

图 4|CSA:先压缩 KV,再由 Lightning Indexer 选择与当前问题最相关的块,同时保留近期滑动窗口。来源:官方技术报告 Figure 3。

CSA 可以理解为先把长会议记录压成许多摘要块,再让索引器只找出当前问题真正相关的几块。它既减少了需要保存的 KV Cache,也减少了每次注意力计算要扫描的范围。

HCA 把更远的历史压得更狠

图 5|HCA:对远距离历史进行更高比例压缩,再对压缩后的短序列做稠密注意力。来源:官方技术报告 Figure 4。

HCA 不再精挑细选,而是把很远的历史压缩成极短的全局记忆。近期信息保留细节,远期信息保留轮廓。两种机制交替出现,使百万 Token 不只是"能塞进去",而是尽可能做到"塞进去后还能用得起"。

图 6|官方报告中的效率对比:在超长上下文下,V4 Flash 的单 Token FLOPs 与 KV Cache 增长明显低于 V3.2。来源:官方技术报告 Figure 1。

Agent 不只是记得多,还要连续做事

V4 还改变了工具调用期间的思考管理。普通聊天中,新一轮问题到来时可以丢掉旧推理,避免上下文越来越臃肿;但在工具调用场景里,模型会保留跨轮次的推理状态,不必每次重新恢复"我已经做到哪一步"。

图 7|有工具调用时保留跨轮思考;普通对话时按轮清理。来源:官方技术报告 Figure 7。

0731 模型还附带 DSpark 推测解码模块。通俗理解,就是模型先向前猜一小段,再由主模型一次性验证。猜对的部分可以批量通过,减少逐字等待。它不会凭空提升答案质量,但能降低 Agent 长输出和多轮执行中的延迟。

另外,V4 使用 mHC 强化层与层之间的信息传递,并在训练中采用 Muon 优化器提升收敛效率和稳定性。技术报告显示,V4 系列在超过 32T Token 的数据上预训练;而 0731 的重点,则是继续用后训练把这些底层能力变成更可靠的工具使用行为。

它带来的影响,不只是新一轮价格战

图 8|AIgoYuri 基于官方技术与定价信息整理的产品影响。

对开发者来说,过去很多 Agent 项目不是模型不会做,而是上下文越跑越长、成本越滚越大、工具链中途失控。V4 Flash 同时降低输入价格、KV Cache 压力和长任务计算量,意味着同一笔预算可以进行更多次尝试、回滚和验证。

对 AI 创业者来说,模型本身正在越来越像云计算基础设施:能力逐渐接近,调用价格不断下降。真正拉开差距的,将不再是"我接入了哪个模型",而是你有没有独家数据、稳定工作流、评测体系,以及能不能把模型输出变成客户愿意付费的结果。

对开源生态来说,V4 Flash 权重采用 MIT 许可证,具备本地部署和二次开发空间。不过 284B 总参数仍不是消费级显卡模型。它的"便宜"首先体现在官方 API 和大规模推理效率上,不代表普通电脑可以轻松完整部署。

我的结论:DeepSeek V4 Flash 0731 最值得关注的不是某一项榜单,而是它把"高性能 Agent + 百万上下文 + 极低 API 价格"放进了同一个产品。模型价格继续下降后,最值钱的将是任务定义、数据闭环和真正可交付的产品。


发布时需要保留的三个注释

  1. 0731 目前是 API 公测版本;官方明确说明,这次仅升级 V4 Flash API,Web、App 与 V4 Pro 当时没有同步更新。
  2. 官方预告将引入峰谷定价,北京时间 9:00–12:00 与 14:00–18:00 的价格可能为常规价格 2 倍,生效时间以公告为准。
  3. 官方基准依赖指定推理强度与 Agent Harness,部分数据集为内部测试;产品选型仍应使用自己的真实任务进行回归评测。

官方资料来源

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐