2026年8月13日,DeepSeek V4 Pro正式版上线。

相比几个月前的Preview版本,正式版在Agent能力上有了显著提升,同时进行了价格调整和峰谷定价机制引入。

这两件事放在一起,其实折射出AI行业正在经历的一个重要转折:当AI从"会聊天"走向"能干活",整个商业模式和技术架构都在重构。

一、先看产品:V4 Pro正式版做了什么

1.1 核心参数

正式版的模型版本为DeepSeek-V4-Pro-0813,参数配置如下:

  • 1.6万亿总参数、490亿激活参数的MoE架构
  • 1M上下文窗口
  • 384K输出长度
  • 支持thinking/non-thinking双模式
  • 接口同时兼容OpenAI和Anthropic两套格式

接口兼容Anthropic格式这一点值得关注——这意味着接入Claude Code等Agent框架时,切换成本很低,有利于开发者快速迁移。

1.2 Agent能力提升

相比Preview版本,正式版在Agent与代码基准上的提升明显:

基准

Preview

正式版

提升

DeepSWE(软件工程)

12.8

62.7

+49.9

Terminal Bench 2.1(终端操作)

72.1

87.9

+15.8

CyberGym(网络安全)

52.7

83.3

+30.6

NL2Repo(自然语言转代码仓库)

38.5

61.5

+23.0

其中DeepSWE从12.8提升到62.7,这个基准考核的不是"会不会写一段代码",而是"能不能像工程师一样持续完成工程任务"。

官方的叙事也发生了变化:从强调"更会答题"转向强调"更能把一件事干完"。这个转向本身就说明了行业重心的迁移——从对话能力转向任务执行能力。

1.3 峰谷定价机制

正式版同步引入了峰谷定价:工作日高峰时段与夜间、周末、节假日实行差异化价格。

这个机制本质上是用价格杠杆调节算力资源的分配,引导用户错峰使用。类似的定价策略在云计算行业并不罕见,AWS、阿里云等都有类似的预留实例与按需实例的差异化定价。

二、评测差异:不同维度看V4 Pro

2.1 专项能力 vs 综合智能

官方公布的Agent基准成绩提升显著,但第三方评测机构Artificial Analysis给出的综合智能指数相对保守。

这并非矛盾,而是评测维度不同:

  • Agent专项基准:侧重工具调用、代码生成、任务分解等工程执行能力
  • 综合智能指数:多项基础能力的加权平均,涵盖问答、写作、分析等日常场景

这组对比说明一个行业现状:当前AI模型在专项工程任务上的进步速度,已经超过了通用智能的进步速度。 模型越来越擅长特定领域的复杂任务,但通用对话和写作能力的提升幅度相对有限。

2.2 实际场景中的表现

不同测试场景下,V4 Pro展现出差异化能力:

在创意类和前端工程任务中表现突出。有媒体将其接入真实Agent环境测试,在3D场景构建、交互式应用开发、多风格设计生成等任务中,完成了完整可用的作品。

在长周期自主执行场景中,模型的稳定性仍有提升空间。这并非V4 Pro独有的问题,而是当前Agent框架面临的共性挑战——长时间自主运行时的上下文管理和任务持续性,是整个行业正在攻克的难点。

三、行业趋势:AI从"对话"走向"执行"

3.1 Agent能力成为核心竞争维度

V4 Pro正式版的发布,是整个AI行业重心迁移的一个缩影。

2024年,各家厂商比拼的是对话质量和知识广度;2025到2026年,竞争焦点已经转向Agent能力——即模型能否自主规划、调用工具、持续执行复杂任务。

DeepSWE、Terminal Bench、CyberGym这些基准的受关注度上升,本身就反映了行业评价体系的变化。用户不再只问"AI能不能回答我的问题",而是开始问"AI能不能帮我完成一件事"。

3.2 定价机制的演进

峰谷定价的引入,反映了AI行业基础设施层面的现实:算力资源的供给和需求在时间上存在不均衡。

这与云计算行业的发展路径一致。早期云服务商以统一价格揽客,随着规模扩大,逐步引入预留实例、竞价实例、按需实例等差异化定价机制,用价格信号引导资源高效分配。

AI模型的定价正在经历类似的演化:从单一价格,到峰谷定价,未来可能还会出现按任务复杂度、按响应速度等更多维度的差异化定价。

3.3 开发者的应对策略

面对模型能力分化加剧和定价机制复杂化,开发者的策略也在调整:

模型分级路由成为常见实践。日常简单任务调用轻量模型控制成本,复杂工程任务才调用能力更强的高级模型。这种分层使用方式,在保证任务质量的同时有效控制了整体API支出。

错峰调度也成为成本优化手段。将批量处理任务安排在低峰时段执行,既降低了成本,也缓解了高峰时段的资源压力。

四、对技术从业者的启示

启示一:Agent能力是下一个技术红利窗口

V4 Pro在Agent基准上的提升,代表了一个明确的趋势:能够自主执行复杂任务的AI,正在从概念走向实用。 技术从业者应该关注Agent开发框架、工具调用接口、任务编排等方向,这些技能的价值正在快速上升。

启示二:模型选型能力越来越重要

模型数量在增加,能力维度在分化,定价机制在复杂化。 能够根据任务特征选择合适模型、动态调整路由策略的能力,正在成为技术团队的核心竞争力。

启示三:关注评测体系的多元化

单一评测分数已经不足以衡量模型的真实能力。 官方基准、第三方评测、自建评测集的交叉验证,是做出可靠技术选型的基础。

收尾:AI正在进入"做事"的阶段

DeepSeek V4 Pro正式版的发布,是一个行业信号:AI正在从"对话"阶段进入"执行"阶段。

模型能力的提升、定价机制的演进、开发者策略的调整,这些变化指向同一个方向——AI不再只是回答问题的工具,而是正在成为完成任务的协作伙伴。

对技术从业者来说,这个转折意味着新的能力要求和新的机会。理解Agent架构、掌握模型选型、适应差异化定价,这些正在成为AI时代的基础技能。

行业在变,技能栈也在变。提前布局的人,会在下一轮浪潮中占据有利位置。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐