DeepSeek-V4正式版终于上线,但它真正想说的不是“我更强了“
7 月 31 日,DeepSeek-V4-Flash 正式版 API 上线,进入公测。
如果你只看标题,可能觉得"哦,又一个版本更新"。
但这次更新里有一句话,比分数重要得多。
DeepSeek 自己写的是:
"正在将竞争重点从传统对话和代码补全,进一步转向 Coding Agent、工具调用和自动化执行。"
这句话翻译过来就是:
模型不再满足于"陪你聊天、帮你补全代码"了。它想自己上手干活。
还记得半年前那款爆款游戏吗
我们之前拆解过一款叫 AgenTank 的 AI 游戏。
它的玩法很反直觉:你不是操作坦克,你是训练一个 AI 坦克去打排位。你写提示词、看回放、改策略,让 AI 越来越强。
当时我们提炼过一个公式:
AI 爆款 = 经典玩法 × AI Agent 化 × 极低成本 × 竞技社交 × 玩家自带算力
那篇文章里最重要的一句话是:
"不要做 AI 陪玩,做 AI 被玩——核心玩法是玩家训练 AI,不是 AI 陪玩家。"
当时那只是对一个游戏的观察。
现在回过头看,整个大模型行业,正在走同一条路:从"AI 陪你"走向"AI 替你干"。
DeepSeek-V4-Flash 正式版,就是这句判断的最新证据。
这次更新,到底变了什么
直接看官方数据。下面这张表来自 DeepSeek 官方 API 更新日志的完整对比,同时加入了 GLM-5.2 和 Claude Opus-4.8 作参照:
|
基准测试 |
Flash 0731 正式版 |
Flash Preview |
Pro Preview |
GLM-5.2 |
Opus-4.8 |
测的是什么 |
|
Terminal Bench 2.1 |
82.7 |
61.8 |
72.1 |
81.0 |
85.0 |
终端环境实际操作 |
|
NL2Repo |
54.2 |
39.4 |
38.5 |
48.9 |
69.7 |
代码仓库理解 |
|
Cybergym |
76.7 |
38.7 |
52.7 |
- |
83.1 |
网络安全 Agent 任务 |
|
DeepSWE |
54.4 |
7.3 |
12.8 |
46.2 |
58.0 |
软件工程修复 |
|
Toolathlon Verified |
70.3 |
49.7 |
55.9 |
59.9 |
76.2 |
多工具协同调用 |
|
Agents' Last Exam |
25.2 |
15.8 |
16.5 |
23.8 |
25.7 |
长程 Agent 推理 |
|
AutomationBench (Public) |
25.1 |
10.8 |
12.8 |
12.9 |
27.2 |
自动化执行 |
|
DSBench-FullStack |
68.7 |
37.0 |
41.8 |
61.8 |
71.6 |
全栈数据科学任务 |
|
DSBench-Hard |
59.6 |
25.8 |
31.1 |
54.5 |
71.7 |
高难度数据科学任务 |
(数据来源:DeepSeek 官方 API 更新日志;GLM-5.2 部分分数经 Hugging Face 模型卡交叉核对。)
几个一眼能看出的结论:
- Flash 正式版 9 项全部超过预览版,平均涨幅巨大。 比如 DeepSWE 从 7.3 涨到 54.4,Cybergym 从 38.7 涨到 76.7——这些不是小数点后波动,是能力层面的质变。
- Pro Preview preview 也被正式版 Flash 反超。 除了 NL2Repo 基本持平,其余 8 项里 Flash 正式版都超过了 Pro 预览版。这说明后训练带来的 Agent 能力提升,甚至能让轻量版反超自家旗舰预览版。
- 和 GLM-5.2、Opus-4.8 比,Flash 正式版不是每项都第一,但差距已经很小。 Terminal Bench 2.1 上,Flash 82.7 对 GLM-5.2 的 81.0、Opus-4.8 的 85.0,基本在同一梯队。DeepSWE、Toolathlon 上 Opus-4.8 仍领先,但 Flash 的价格可能只有它的几分之一。
- Kimi K3 没在这张表里,但顺手比一下: Kimi K3 在 Terminal Bench 2.1 上拿了 88.3,DeepSWE 上拿了 67.5,两项都高于 Flash 正式版。K3 是 2.8 万亿参数的旗舰,Flash 是 2840 亿参数的轻量版,本就不是一个定位,但国产模型在 Agent 赛道上确实都在往上拱。
⚠️ 一个需要注意的口径问题:Opus-4.8 的 Terminal Bench 2.1 分数,这张图里是 85.0,但 llm-stats 等第三方引用的 Anthropic 官方口径是 74.6%。两个数字差距不小,大概率是评估 harness/设置不同导致的。读 benchmark 时,同一个测试名字下可能藏着不同的跑法,这是常见坑。
模型结构没变,参数没变,只做了后训练。
也就是说,DeepSeek 没靠"堆参数"变强,而是靠重新训练把 Agent 能力逼了出来。后训练(post-training)的红利,比很多人以为的更大。
几个关键点:
- 模型结构没变,参数没变,只做了后训练。 也就是说,DeepSeek 没靠"堆参数"变强,而是靠重新训练把 Agent 能力逼了出来。
- 原生支持 Responses API,并针对 Codex 做了适配。 这意味着它能直接接入智能体的工具调用框架,不是一个"裸模型"。
- V4-Pro 正式版"后续发布",APP 和 Web 端模型暂时没动。 普通聊天用户暂时无感,但开发者的工作流已经可以用了。
最值得注意的是官方那句原话——竞争重点的转移。
这不是功能更新,这是战略转向。
"会聊天"和"能干活",是两代模型
把两种模型放在一起,区别一目了然:
|
维度 |
会聊天的模型 |
能干活的 Agent 模型 |
|
核心能力 |
生成文本、补全代码 |
调用工具、执行任务、跑通流程 |
|
交互方式 |
一问一答 |
多步推理 + 自主决策 |
|
衡量标准 |
文采、逻辑、知识量 |
任务完成率、工具调用准确率 |
|
典型场景 |
写文章、答题、翻译 |
自动化测试、数据清洗、部署上线 |
|
失败代价 |
答错了重问 |
调错了可能删库(所以需要强约束) |
过去的模型,你问它"怎么写一个排序函数",它给你代码。
现在的 Agent 模型,你告诉它"把我这个项目从 PC 端移植到移动端",它自己读代码库、改文件、跑测试、修 bug。
从"教你做"到"替你做",这是本质区别。
DeepSeek 这次的分数,Terminal Bench 82.7、Toolathlon 70.3,测的恰恰是后者——在真实环境里,它能不能真的把事办成。
这不是 DeepSeek 一家的事
千万别以为这只是 DeepSeek 的动作。
把视线拉宽一点:
- OpenAI:GPT 系列全力推 Operator、Codex,让模型直接操作电脑、跑代码
- Anthropic:Claude 的 Computer Use、MCP 协议,主打"模型接入真实工具链"
- Google:Gemini 深度绑定 Workspace,让 Agent 在文档、表格、邮件里干活
- 国内:智谱 GLM-5.2 主打"工程级 Agent",Kimi K3 也把软件工程列为核心场景
全行业在同一个方向上加速:让模型从"大脑"变成"手"。
DeepSeek 这次的转向,只是把这个趋势又往前推了一步。
对开发者来说,这意味着什么
如果你在用 AI 写代码,或者正在做 AI 相关的产品,这次更新释放的信号很明确:
"写代码"的门槛还会继续往下掉,"定义任务"的能力会越来越值钱。
以前你的竞争力是"我代码写得好"。
以后你的竞争力变成:"我能把一个模糊的业务目标,拆解成 AI Agent 能稳定执行的任务链。"
具体到 DeepSeek-V4-Flash 正式版:
- 如果你是做自动化测试、DevOps、数据管道的,值得真的去测一轮——官方说 Terminal Bench 82.7,但文章也提醒了:"真正需要关注的是,它在真实项目中能否稳定完成任务、正确调用工具、减少无效重试。"
- 分数只是门票,真实项目里的稳定性才是决赛。
- V4-Pro 正式版还没来,如果你对推理深度要求高,可以再等等。
最后
半年前我们写 AgenTank 的时候,说"AI Agent 化"会是一个真实存在的品类。
当时那只是对一个游戏的判断。
现在 DeepSeek 用一次正式版更新告诉我们:模型厂商自己,也在把船头调向同一个方向。
从"会聊天"到"能干活",不是一句口号。
Terminal Bench 82.7 是,Toolathlon 70.3 是,原生支持 Responses API 也是。
当模型开始自己读代码、调工具、跑任务——
它不再是你的工具,它开始变成你的同事。
而这一程,国产模型和海外巨头,站在同一条起跑线上。
V4-Pro 正式版还没来。但 Flash 这一步,已经把"Agent 化"三个字,从趋势变成了默认。
更多推荐



所有评论(0)