2026年8月13日更新 | 基于 DeepSeek-V4-Pro-0813 正式版 API 上线首日数据撰写

一句话速览

8月13日凌晨,DeepSeek 悄然将 V4 Pro 从预览版正式转正。没有发布会,只有一行版本号更新——但 Agent 相关基准测试的全面暴涨,让开发者社区瞬间炸锅。作为当前最具性价比的 AI Agent工具 级大模型之一,V4 Pro 正式版值得每一个做 Agent 开发的团队认真评估。

一、核心参数:架构不变,后训练大改

V4 Pro 正式版的模型架构与预览版完全一致——1.6T 总参数、49B 激活参数的 MoE 结构,变化的全部集中在后训练阶段。

核心规格一览:

参数

数值

上下文窗口

1M Token

最大输出

384K Token

推理模式

三档(Non-Think / Think High / Think Max)

默认模式

Thinking 开启

并发限制

500

对于需要处理大型代码仓库、长文档分析、多步骤 Agent 任务的开发者来说,1M 上下文 + 384K 输出是目前国产模型中的头部水平。

📎 数据来源:DeepSeek 官方 API 文档

二、Agent能力:从"几乎不可用"到"正面对打"

这次正式版最核心的升级信号就是 Agent 能力。以下是与预览版的对比:

评测集

预览版

正式版

提升幅度

DeepSWE(软件工程 Agent)

12.8

62.7

+390%

Cybergym(安全攻防 Agent)

52.7

83.3

+58%

Terminal Bench 2.1(终端操作)

72.1

87.9

+22%

DSBench-Hard(高难编码)

31.1

67.2

+116%

AutomationBench(工作流 Agent)

12.8

31.8

+148%

几个关键对标:

DeepSWE 62.7:超过 Claude Opus 4.8 的 58.0,逼近 Fable 5

Terminal Bench 87.9:距 Fable 5 的 88.0 仅差 0.1 分

Cybergym 83.3:以 0.2 分微弱优势反超 Fable 5(83.1)

HLE 带工具 60.0:反超 Opus 4.8 的 57.9,说明工具调用能力已能弥补纯推理短板

但也有短板——HLE 无工具(纯知识推理)42.7 分,落后 Opus 4.8(49.8)和 Fable 5(53.3);NL2Repo 61.5,落后 Opus 4.8(69.7)。简单说:干活能力追上了,考试能力还差点

📎 数据来源:极客公园实测报告36氪深度评测

三、API兼容性:一套代码通吃双生态

V4 Pro 正式版新增了两个 API 协议兼容,对开发者迁移极其友好:

1. OpenAI Responses API(新增)——可直接接入 Codex 等工具

2. Anthropic API 协议(新增)——现有 Claude Code 工作流可零改动切换

3. 标准 OpenAI Chat Completions(不变)

同时还支持 JSON Output、Tool Calls、对话前缀续写(Beta),FIM 补全(Beta)仅限非思考模式。

这意味着:如果你已经在用 Claude Code 或 OpenAI 生态开发 AI Agent工具,只需切换 base_url 和 api_key,代码零改动即可测试 V4 Pro 的能力。

📎 数据来源:博客园技术拆解

四、定价:3元/百万Token的"临时窗口期"

计费项

V4 Pro

V4 Flash

倍率

输入(缓存未命中)

¥3/M

¥1/M

输入(缓存命中)

¥0.025/M

¥0.02/M

~1.25×

输出

¥6/M

¥2/M

并发限制

500

2500

1/5

横向对比闭源模型:V4 Pro 输出价格约 0.87 美元/百万 Token,仅为 Fable 5(50 美元)的 1/57、GPT-5.6 Sol(30 美元)的 1/34

⚠️ 重要提醒:官方已在定价页明确标注——"计划近期整体上调 API 服务定价,预计涨幅较大"。当前价格窗口能持续多久尚不明确,有长期调用计划的开发者建议尽早评估用量和缓存策略。

📎 数据来源:DeepSeek 官方定价页

五、开发者该怎么用?三条实战建议

1. 缓存策略是第一优先级

V4 Pro 缓存命中价仅为未命中的 1/120。如果你的 Agent 场景有大量重复 system prompt 或固定上下文(如 RAG 知识库、智能客服),把缓存命中率做上去是最现实的对冲涨价手段。

2. Thinking 模式要按需开关

实测发现,默认 Thinking 模式在复杂代码生成场景下,推理 Token 可能占输出的 80% 以上,反而挤压实际代码空间。需要大段代码输出时,建议关闭 Thinking 或大幅提高 max_tokens

3. Pro + Flash 搭配使用

Flash 主打高频、低成本、高并发(2500 并发限制),Pro 负责复杂推理和长任务。大多数日常任务用 Flash 就够了,只有遇到超长上下文、复杂 Agent 链路时才需要上 Pro。

六、写在最后

V4 Pro 正式版的上线,让 DeepSeek V4 系列的产品分层彻底清晰:Flash 走量、Pro 攻坚

Agent 能力从预览版的"几乎不可用"暴涨到能与全球顶尖闭源模型正面对打,而价格仅为 Fable 5 的 1/57——这条"比我强的没我便宜,比我便宜的没我强"的定律,在正式版发布后的杀伤力又上了一个量级。

同一天,xAI 发布了 Grok 4.6 也走极致性价比路线。大模型 API 市场的竞争正在从"谁的 Token 最便宜"转向"谁完成一个任务的总成本最低"。

对于开发者来说,现在最值得做的两件事:趁涨价窗口锁定用量,把缓存策略做扎实

参考来源:

1. DeepSeek 官方 API 文档

2. 极客公园:实测正式版 DeepSeek V4 Pro

3. 36氪:Deepseek V4 Pro发布评测

4. 博客园:DeepSeek V4 Pro 0813 全面拆解

5. DeepSeek 官方定价页

AI 标注:本文由 AI 辅助生成,数据来源于公开报道与官方文档,已经过人工核实与编辑。文中观点仅供参考,请以官方最新信息为准。

作者:落子AI

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐