7 月 31 日,DeepSeek-V4-Flash 正式版 API 上线,进入公测。

如果你只看标题,可能觉得"哦,又一个版本更新"。

但这次更新里有一句话,比分数重要得多。

DeepSeek 自己写的是:

"正在将竞争重点从传统对话和代码补全,进一步转向 Coding Agent、工具调用和自动化执行。"

这句话翻译过来就是:

模型不再满足于"陪你聊天、帮你补全代码"了。它想自己上手干活。


还记得半年前那款爆款游戏吗

我们之前拆解过一款叫 AgenTank 的 AI 游戏。

它的玩法很反直觉:你不是操作坦克,你是训练一个 AI 坦克去打排位。你写提示词、看回放、改策略,让 AI 越来越强。

当时我们提炼过一个公式:

AI 爆款 = 经典玩法 × AI Agent 化 × 极低成本 × 竞技社交 × 玩家自带算力

那篇文章里最重要的一句话是:

"不要做 AI 陪玩,做 AI 被玩——核心玩法是玩家训练 AI,不是 AI 陪玩家。"

当时那只是对一个游戏的观察。

现在回过头看,整个大模型行业,正在走同一条路:从"AI 陪你"走向"AI 替你干"。

DeepSeek-V4-Flash 正式版,就是这句判断的最新证据。


这次更新,到底变了什么

直接看官方数据。下面这张表来自 DeepSeek 官方 API 更新日志的完整对比,同时加入了 GLM-5.2 和 Claude Opus-4.8 作参照:

基准测试

Flash 0731 正式版

Flash Preview

Pro Preview

GLM-5.2

Opus-4.8

测的是什么

Terminal Bench 2.1

82.7

61.8

72.1

81.0

85.0

终端环境实际操作

NL2Repo

54.2

39.4

38.5

48.9

69.7

代码仓库理解

Cybergym

76.7

38.7

52.7

-

83.1

网络安全 Agent 任务

DeepSWE

54.4

7.3

12.8

46.2

58.0

软件工程修复

Toolathlon Verified

70.3

49.7

55.9

59.9

76.2

多工具协同调用

Agents' Last Exam

25.2

15.8

16.5

23.8

25.7

长程 Agent 推理

AutomationBench (Public)

25.1

10.8

12.8

12.9

27.2

自动化执行

DSBench-FullStack

68.7

37.0

41.8

61.8

71.6

全栈数据科学任务

DSBench-Hard

59.6

25.8

31.1

54.5

71.7

高难度数据科学任务

(数据来源:DeepSeek 官方 API 更新日志;GLM-5.2 部分分数经 Hugging Face 模型卡交叉核对。)

几个一眼能看出的结论:

  1. Flash 正式版 9 项全部超过预览版,平均涨幅巨大。 比如 DeepSWE 从 7.3 涨到 54.4,Cybergym 从 38.7 涨到 76.7——这些不是小数点后波动,是能力层面的质变。
  1. Pro Preview preview 也被正式版 Flash 反超。 除了 NL2Repo 基本持平,其余 8 项里 Flash 正式版都超过了 Pro 预览版。这说明后训练带来的 Agent 能力提升,甚至能让轻量版反超自家旗舰预览版。
  1. 和 GLM-5.2、Opus-4.8 比,Flash 正式版不是每项都第一,但差距已经很小。 Terminal Bench 2.1 上,Flash 82.7 对 GLM-5.2 的 81.0、Opus-4.8 的 85.0,基本在同一梯队。DeepSWE、Toolathlon 上 Opus-4.8 仍领先,但 Flash 的价格可能只有它的几分之一。
  1. Kimi K3 没在这张表里,但顺手比一下: Kimi K3 在 Terminal Bench 2.1 上拿了 88.3,DeepSWE 上拿了 67.5,两项都高于 Flash 正式版。K3 是 2.8 万亿参数的旗舰,Flash 是 2840 亿参数的轻量版,本就不是一个定位,但国产模型在 Agent 赛道上确实都在往上拱。

⚠️ 一个需要注意的口径问题:Opus-4.8 的 Terminal Bench 2.1 分数,这张图里是 85.0,但 llm-stats 等第三方引用的 Anthropic 官方口径是 74.6%。两个数字差距不小,大概率是评估 harness/设置不同导致的。读 benchmark 时,同一个测试名字下可能藏着不同的跑法,这是常见坑。


模型结构没变,参数没变,只做了后训练。

也就是说,DeepSeek 没靠"堆参数"变强,而是靠重新训练把 Agent 能力逼了出来。后训练(post-training)的红利,比很多人以为的更大。

几个关键点:

  1. 模型结构没变,参数没变,只做了后训练。 也就是说,DeepSeek 没靠"堆参数"变强,而是靠重新训练把 Agent 能力逼了出来。
  1. 原生支持 Responses API,并针对 Codex 做了适配。 这意味着它能直接接入智能体的工具调用框架,不是一个"裸模型"。
  1. V4-Pro 正式版"后续发布",APP 和 Web 端模型暂时没动。 普通聊天用户暂时无感,但开发者的工作流已经可以用了。

最值得注意的是官方那句原话——竞争重点的转移

这不是功能更新,这是战略转向


"会聊天"和"能干活",是两代模型

把两种模型放在一起,区别一目了然:

维度

会聊天的模型

能干活的 Agent 模型

核心能力

生成文本、补全代码

调用工具、执行任务、跑通流程

交互方式

一问一答

多步推理 + 自主决策

衡量标准

文采、逻辑、知识量

任务完成率、工具调用准确率

典型场景

写文章、答题、翻译

自动化测试、数据清洗、部署上线

失败代价

答错了重问

调错了可能删库(所以需要强约束)

过去的模型,你问它"怎么写一个排序函数",它给你代码。

现在的 Agent 模型,你告诉它"把我这个项目从 PC 端移植到移动端",它自己读代码库、改文件、跑测试、修 bug。

从"教你做"到"替你做",这是本质区别。

DeepSeek 这次的分数,Terminal Bench 82.7、Toolathlon 70.3,测的恰恰是后者——在真实环境里,它能不能真的把事办成


这不是 DeepSeek 一家的事

千万别以为这只是 DeepSeek 的动作。

把视线拉宽一点:

  • OpenAI:GPT 系列全力推 Operator、Codex,让模型直接操作电脑、跑代码
  • Anthropic:Claude 的 Computer Use、MCP 协议,主打"模型接入真实工具链"
  • Google:Gemini 深度绑定 Workspace,让 Agent 在文档、表格、邮件里干活
  • 国内:智谱 GLM-5.2 主打"工程级 Agent",Kimi K3 也把软件工程列为核心场景

全行业在同一个方向上加速:让模型从"大脑"变成"手"。

DeepSeek 这次的转向,只是把这个趋势又往前推了一步。


对开发者来说,这意味着什么

如果你在用 AI 写代码,或者正在做 AI 相关的产品,这次更新释放的信号很明确:

"写代码"的门槛还会继续往下掉,"定义任务"的能力会越来越值钱。

以前你的竞争力是"我代码写得好"。

以后你的竞争力变成:"我能把一个模糊的业务目标,拆解成 AI Agent 能稳定执行的任务链。"

具体到 DeepSeek-V4-Flash 正式版:

  • 如果你是做自动化测试、DevOps、数据管道的,值得真的去测一轮——官方说 Terminal Bench 82.7,但文章也提醒了:"真正需要关注的是,它在真实项目中能否稳定完成任务、正确调用工具、减少无效重试。"
  • 分数只是门票,真实项目里的稳定性才是决赛
  • V4-Pro 正式版还没来,如果你对推理深度要求高,可以再等等。

最后

半年前我们写 AgenTank 的时候,说"AI Agent 化"会是一个真实存在的品类。

当时那只是对一个游戏的判断。

现在 DeepSeek 用一次正式版更新告诉我们:模型厂商自己,也在把船头调向同一个方向。

从"会聊天"到"能干活",不是一句口号。

Terminal Bench 82.7 是,Toolathlon 70.3 是,原生支持 Responses API 也是。

当模型开始自己读代码、调工具、跑任务——

它不再是你的工具,它开始变成你的同事。

而这一程,国产模型和海外巨头,站在同一条起跑线上。


V4-Pro 正式版还没来。但 Flash 这一步,已经把"Agent 化"三个字,从趋势变成了默认。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐