DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models


论文地址:https://arxiv.org/abs/2512.02556
项目页面:https://huggingface.co/deepseek-ai/DeepSeek-V3.2-Exp/tree/main/inference
进 Q 学术交流群:922230617 或加 CV_EDPJ 进 W 交流群


目录

1. 引言

2. 模型结构

2.1 DeepSeek 稀疏注意力(DSA)

2.2 评估

2.3 推理开销

3. 后训练

3.1 Scaling GRPO

3.2 将思考集成到工具使用

3.2.1 思考上下文管理

3.2.2 Cold-Start

3.2.3 大规模 Agentic 任务

4. 实验结果

4.1 主结果

4.2 DeepSeek-V3.2-Speciale

4.3 合成 Agentic 任务

4.4 搜索智能体的上下文管理

5. 结论与局限


1. 引言

自从 reasoning LLMs 出现后(如 DeepSeek-R1、OpenAI R1),LLM 在可验证领域取得显著进步。但过去数月出现趋势分化:

  • 开源模型(MiniMax、Moonshot、Qwen、ZhiPu-AI 等)仍在进步;

  • 闭源模型(Anthropic、DeepMind、OpenAI)性能提升更快;

  • 开源模型和闭源模型之间的差距正在拉大,而非缩小

开源模型受限的三大核心问题:

  1. 架构层面:仍依赖标准密集注意力(vanilla dense attention),计算复杂度呈二次增长,在长序列场景下效率极低。

  2. 资源层面:开源模型后训练(post-training)的算力投入不足,导致在难题上表现弱。

  3. Agent 层面:开源模型在泛化与指令跟随方面落后,影响真实部署表现。

为解决上述问题,本文提出三项关键突破:

  1. DeepSeek 稀疏注意力(DeepSeek Sparse Attention,DSA):极大降低注意力复杂度,同时在长上下文场景保持性能。

  2. 可扩展的 RL 训练框架:后训练算力达到预训练成本的 10%+,并通过改进的 GRPO 机制使大规模 RL 训练稳定可扩展。

  3. 大规模合成 agentic task pipeline:利用 1800+ 环境、85k+ prompts 生成复杂任务,使模型在真实工具链任务中具备强鲁棒性与泛化性。

最终,

  • DeepSeek-V3.2 达到与 Kimi-k2-thinking、GPT-5-high 接近的推理能力,同时 agentic 性能显著提升;
  • 其高 compute 版本 V3.2-Speciale 更在 IMO/IOI 等竞赛中达到金牌水平,并超越 Gemini-3.0-Pro。

2. 模型结构

2.1 DeepSeek 稀疏注意力(DSA)

DeepSeek-V3.2 相较于 V3.1-Terminus 的 唯一结构变化 是引入 DSA。它包含两部分:

1)Lightning Indexer

  • 为 query token 计算与 preceding token 的索引分数,来决定哪些 token 被 query token 选择

  • 使用少量 indexer heads(FP8 实现)

  • Lightning Indexer 仅有少量头结构且可在 FP8 格式下运行,计算效率高

  • 复杂度依然为 O(L²)

2)细纹纹理 token 选择(Fine-grained Token Selection)

  • 基于上述分数,为每个 query 选择 top-k 的 key-value(KV)tokens

  • 仅在 query token 和被选中的 KV tokens 上执行注意力计算

  • 复杂度 O(L²) → O(L·k),其中,k 表示被选择的 KV tokens 数量

为兼容 V3.1-Terminus 的继续训练,DSA 在 MLA(Multi-head Latent Attention) 的 MQA 模式下实现:

  • 每个 latent vector(MLA 的 KV entry)跨所有 query token 共享

  • 从而在 kernel 层面确保高复用与高效

继续预训练。以扩展至 128K 上下文长度的 DeepSeek-V3.1-Terminus 基础检查点为起点,通过继续预训练与后训练,最终构建 DeepSeek-V3.2 模型。

继续预训练分两阶段:

1)密集 Warm-Up 阶段。保留 dense attention,冻结除 lightning indexer 外的所有参数。

为对齐 indexer 输出与主注意力(main attention)分布,对于第 𝑡 个 query token,

  • 首先通过对所有注意力头的注意力得分 I 求和进行聚合
  • 随后沿序列维度对该求和结果进行 L1 归一化处理,以生成目标概率分布 p
  • 训练 1000 steps,共 2.1B tokens

2)稀疏阶段

  • 引入 fine-grained token selection
  • indexer 输出继续与主注意力对齐,但只是用选择的 Top-k token 集 S
  • 其中,indexer 的输入从计算图中分离以实现独立优化。索引器的训练信号仅来源于损失函数 𝐿^𝐼,而主模型的优化则完全基于语言建模损失进行
  • 每个 query token 选择 k = 2048 个 KV tokens,训练 15000 steps,共 943.7B tokens

2.2 评估

对比 V3.1-Terminus:

  • 标准Benchmark: 短/长上下文任务性能无明显下降

  • 人类偏好:ChatbotArena Elo 得分接近

  • 长上下文:评测(如 AA-LCR、Fiction.liveBench)中甚至略有提升

2.3 推理开销

虽然 lightning indexer 的计算复杂度仍为 O(L²),但与 DeepSeek-V3.1-Terminus 中使用的 MLA 相比,其实际计算量已显著降低。

由于主注意力从 O(L²) → O(L·k),实际部署(H800 GPU)中观察到:

  • 在长上下文场景下,prefill 和 decode 速度明显加快

  • 在短上下文场景下,使用 masked MHA 模拟 DSA,从而实现高效

3. 后训练

DeepSeek-V3.2 的后训练完全使用 sparse attention。

后训练包括两部分:

1)专家蒸馏(Specialist Distillation)

为了提升模型在不同领域的能力,首先构建了一组专家模型,这些专家共享 DeepSeek-V3.2 的 base checkpoint。

除写作(writing)和通用问答(general QA)外,还分别针对六个不同任务域进行监督微调,包括:

  • 数学(math)

  • 编程(programming)

  • 通用逻辑推理(general logical reasoning)

  • 通用 agentic 任务

  • agentic coding

  • agentic search

每个专家模型均通过 大规模强化学习计算(large-scale RL computing)进行训练。

此外,采用不同模型生成训练数据,这些数据分别对应长链思维推理(思考模式)和直接响应生成(非思考模式)。

专家模型准备就绪后,将用于为最终检查点生成领域特定数据。

实验结果表明,使用蒸馏数据训练的模型性能仅略低于领域专家模型,且通过后续强化学习训练能有效消除这一性能差距。

2)混合 RL 训练

DeepSeek-V3.2 仍采用 GRPO(Group Relative Policy Optimization)作为 RL 训练算法。

DeepSeek-V3.2-Exp 将推理(reasoning)、智能体(agent)、对齐(alignment)训练,合并到单一 RL stage。

  • 有效平衡多领域性能,且避免灾难性遗忘(catastrophic forgetting)

  • 对于推理与智能体任务,采用基于规则的结果奖励、长度惩罚及语言一致性奖励;

  • 对于通用任务,使用生成式奖励模型,其中每个提示均设有专属评估标准

DeepSeek-V3.2-Speciale 是 DeepSeek-V3.2 的一个实验性变体:

  • 该模型专门使用推理数据进行训练,并在强化学习中降低长度惩罚权重

  • 还整合了DeepSeekMath-V2 的数据集与奖励方法,以增强数学证明能力

3.1 Scaling GRPO

GRPO 通过最大化目标函数来优化策略模型 𝜋_θ,该函数基于从旧策略 𝜋_old 中针对每个问题 𝑞 采样得到的一组响应 {𝑜_1, ..., 𝑜_𝐺} 进行最大化:

为稳定 RL 扩展,对 GRPO 提出以下关键改进:

1)无偏 KL 估计(Unbiased KL Estimate)

  • 修正 K3 estimator,利用当前策略 𝜋_θ 与旧策略 𝜋_old 之间的重要性采样比,从而获得无偏的 KL 估计,

  • 消除偏差梯度,有利于稳定收敛

实践中发现,不同领域得益于不同强度的 KL 正则化。对于数学等特定领域,施加较弱的 KL 惩罚甚至完全省略惩罚项反而能获得更好的性能表现。

2)Off-Policy Sequence Masking

off-policy:

  • 在大规模 RL 训练中,通常一次性生成一个大型 rollout 数据 batch,并将其划分为多个 mini-batch,用于多轮梯度更新。这样的训练方式天然会引入 off-policy 行为
  • 此外,实际的高效数据生成通常依赖于高度优化的推理框架,而这些框架在具体实现上可能与训练框架存在差异,这种 训练和推理之间的不一致 会进一步加剧 off-policy 程度。

为了解决上述问题并提高模型对 off-policy 更新的容忍度:

  • 在训练过程中对 会导致显著 policy divergence 的负序列 进行掩码操作。
  • 具体而言,使用旧策略 𝜋_old 与当前策略 𝜋_θ 之间的 KL 散度 来衡量策略偏离程度,并将此作为筛选依据。
  • 在算法实现中,在 GRPO 的损失函数中引入一个 二值掩码 M,用于屏蔽这些会造成严重策略偏移的序列,以此稳定训练并减少无效梯度更新。

其中,𝛿 是控制策略离散度阈值的超参数

3)Keep Routing

  • MoE 模型的 推理与训练框架不一致 可能导致 专家路由不一致,即使输入相同,这会导致激活的参数子空间突然变化,破坏训练稳定性并加剧 off-policy 问题。

  • 为避免这种不一致,在训练中 强制使用推理阶段生成的专家路由,确保优化的是同一组专家参数。

  • 该机制对 RL 稳定性至关重要,并自 DeepSeek-V3-0324 起应用于 RL 流程。

4)Keep Sampling Mask

  • top-p / top-k 采样能提升生成质量,但在 RL 中会让旧策略 𝜋_old 与当前策略 𝜋_θ 的 动作空间不同,从而破坏重要性采样并导致训练不稳定。

  • 为解决此问题,可 保留 rollout 时的采样截断 mask,并在训练中将同一 mask 应用于 𝜋_θ,使两个策略共享一致的动作子空间。

  • 实验表明,top-p 结合 Keep Sampling Mask 能有效保持 RL 训练的语言一致性。

3.2 将思考集成到工具使用

3.2.1 思考上下文管理

复现 DeepSeek-R1 的策略(第二轮消息到来时丢弃推理内容)会造成明显的 token 浪费,因为模型在每次工具调用时都必须重新推理整个问题。

为避免这一点,为工具调用场景设计了专门的上下文管理策略:

  • 仅在出现新的用户消息时才丢弃历史推理内容;若追加的只是工具相关消息(如工具输出),则持续保留推理内容。

  • 即使推理内容被移除,工具调用及其结果的历史仍保留在上下文中。

3.2.2 Cold-Start

在已有推理数据(非 agentic)与非推理的 agentic 数据的基础上,一种直接的整合方式是通过精心设计 prompt。模型在明确指令下具备足够能力在推理过程中执行工具调用。

为展示 cold-start 机制的工作方式,训练数据的部分样例列于表 6–8。不同的任务 prompt 对应不同的 system prompt:

  • 表 6:reasoning 数据示例。system prompt 要求模型在最终答案前进行推理,用 <think></think> 标签标注思维路径。

  • 表 7:非推理 agentic 数据示例。system prompt 含工具调用指引。

  • 表 8:用于 instruct 模型在推理过程中整合多次工具调用的 system prompt 示例。

通过这种设置,尽管模型在工具使用模式下的推理仍不够稳健,但它能够偶尔生成所需轨迹,从而为后续 RL 阶段提供基础。

3.2.3 大规模 Agentic 任务

可使用多样化的 RL 任务,来增强模型的鲁棒性。

  • 对于搜索、代码工程、代码解释等任务,使用真实世界工具,例如真实的网页搜索 API、代码工具以及 Jupyter Notebook。尽管这些 RL 环境是真实的,但其使用的 prompts 来自互联网抓取或合成生成,而非来自真实用户交互。
  • 对于其他任务,环境和 prompts 均为合成构建。

Search Agent。搜索类任务使用基于 DeepSeek-V3.2 的多代理流水线生成高质量、多样化的数据。流程包括:

  • 实体采样:从大规模网页语料中采样跨领域的长尾实体。

  • 问题构造:question-construction agent 使用搜索工具(带可调深度与宽度参数)探索每个实体,并将所得信息整合为问答对。

  • 候选答案生成:多个具有异质配置的 answer-generation agents(不同 checkpoints、system prompts 等)为每个 QA 对生成多样化候选答案。

  • 验证:带搜索能力的 verification agent 多轮验证所有答案,仅保留 “ground-truth 正确且所有候选答案可验证为错误” 的样本。

生成的数据覆盖多语言、多领域、多难度等级。

  • 为使数据更符合实际使用场景,还补充了一部分来自已有 helpful RL 数据集,且搜索工具可提供实质性帮助的筛选样本。
  • 随后,构建多维度质量的评估细则,并使用生成式奖励模型(generative reward model)依据这些细则对回答进行打分。
  • 该混合方案使模型能够同时优化事实可靠性与实际有用性。

Code Agent。从 GitHub 挖掘了数百万条 issue–PR 配对,并据此构建了大规模、可执行的软件问题修复环境。该数据集经过启发式规则与 LLM 判断严格筛选,要求每个样本包含:

  • 合理的问题描述,

  • 对应的 gold patch,

  • 可用于验证的 test patch。

随后,使用基于 DeepSeek-V3.2 的自动环境搭建代理负责:包(package)安装、依赖解析、测试执行等步骤。

测试结果采用统一的 JUnit 格式,便于跨语言解析。环境被视为 “成功构建” 需满足:

  • gold patch 使 F2P(false-to-positive)计数 > 0(说明修复成功),

  • P2F(pass-to-fail)计数 = 0(说明无回归)。

通过该流程,成功构建了覆盖 Python、Java、JavaScript、TypeScript、C、C++、Go、PHP 等多语言的数万条可复现修复环境。

Code Interpreter Agent。

  • 使用 Jupyter Notebook 作为代码解释器,用于处理需要代码执行才能求解的复杂推理任务。
  • 为此,整理了覆盖数学、逻辑、数据科学等领域的任务集,每个任务都依赖代码执行能力来获得最终解答。

General Agent。为在 RL 中扩展 agent 环境和任务,采用自动环境合成 agent,共构建 1,827 个面向任务的环境。其特点为:难解但易验证

合成流程具体步骤如下:

  • 环境与工具集构建:给定任务类别(如旅行规划)和包含 bash 与搜索工具的 sandbox,代理首先生成或检索相关数据并存储到数据库。

  • 任务合成:基于数据库,代理合成一组任务相关工具,每个工具均实现为一个函数。

  • 解答生成:为确保任务可验证且具挑战性,代理先构造简单任务、对应的解答函数和验证函数。限制要求:

    • 解答函数只能调用工具函数或执行逻辑计算,

    • 不得访问数据库或调用其他函数。

    • 解答输出必须通过验证函数检查。若验证失败,代理会反复修改解答或验证函数。

    • 在任务难度提升过程中,若现有工具不足以求解,代理会扩展工具集。

依此流程获得数千条 <environment, tools, task, verifier> 组合。随后使用 DeepSeek-V3.2 进行 RL,仅保留 pass@100 非零的实例,最终得到 1,827 个环境及对应 4,417 个任务。

一个合成的 trip-planning 示例如上图所示,说明:

  • 遍历组合空间以找到满足所有约束的方案十分困难;

  • 但验证某个候选方案是否满足约束相对容易。

4. 实验结果

4.1 主结果

DeepSeek-V3.2:

  • English(reasoning):接近 GPT-5-high,略弱于 Gemini-3.0-Pro

  • code agent:明显优于所有开源模型

  • search agent:使用 context management 后达到 67.6(超越了 GPT5)

  • tool use:优于现有开源模型,显著缩小开源与闭源差距,但仍落后于 frontier 模型

4.2 DeepSeek-V3.2-Speciale

表 3 显示,DeepSeek-V3.2-Speciale 通过增加推理 token 量实现了卓越性能,在多个基准测试中超越了当前最先进的 Gemini-3.0-Pro。

然而,DeepSeek-V3.2-Speciale 的 token 有效性仍显著低于 Gemini-3.0-Pro。

  • 为降低部署成本与延迟,在官方 DeepSeek-V3.2 的训练过程中实施了更严格的 token 约束,以优化性能与成本的平衡。
  • token 有效性 仍是未来需要重点突破的关键领域。

4.3 合成 Agentic 任务

本节通过消融实验研究合成智能体任务的效果,主要关注两个问题:

  • 其一,合成任务是否能为强化学习提供足够挑战?
  • 其二,这些合成任务的泛化能力如何,即能否迁移至不同的下游任务或真实环境?

1)针对第一个问题,从通用合成智能体任务中随机抽取 50 个实例,分别评估用于合成的模型与前沿闭源大语言模型的表现。

如表 5 所示,

  • DeepSeek-V3.2-Exp 的准确率仅为 12%,而前沿闭源模型最高达到 62%。
  • 这些结果表明,合成数据中包含的智能体任务对 DeepSeek-V3.2-Exp 和前沿闭源模型均构成显著挑战。

2)为探究 基于合成数据的强化学习能否泛化至不同任务或真实环境

  • 对 DeepSeek-V3.2 的监督微调检查点(记为 DeepSeek-V3.2-SFT)进行强化学习。
  • 为排除长链思维推理及其他强化学习数据的影响,仅针对非思考模式下的合成智能体任务实施强化学习。
  • 随后将该模型与 DeepSeek-V3.2-SFT 及 DeepSeek-V3.2-Exp(仅在搜索和代码环境中进行强化学习训练)进行对比。

如图 5 所示

  • 在 Tau2Bench、MCP-Mark 和 MCP-Universe 基准测试中,基于合成数据的大规模强化学习相较 DeepSeek-V3.2-SFT 带来显著提升。
  • 而将强化学习限制在代码与搜索场景的方案未能改善这些基准表现,进一步凸显了合成数据的潜力。

4.4 搜索智能体的上下文管理

即便采用 128K 等扩展上下文窗口,基于搜索的智能体工作流仍常触及长度限制,导致推理过程被过早截断。这一瓶颈制约了测试时计算潜力的充分发挥。

为解决该问题,引入上下文管理机制,通过简单策略在测试时扩展 token 预算——当 token 使用量超过上下文窗口长度的 80% 时,系统将自动触发以下策略:

  • 摘要策略:总结溢出的轨迹后重新开始推理 rollout

  • 弃置 75% 策略:丢弃轨迹中前 75% 的工具调用历史以释放空间

  • 全弃置策略:清空所有过往工具调用历史(类似Anthropic (2025a)的“新上下文工具”)

作为对照,还实现了并行扩展基线方法 Parallel-fewest-step,该方法同时采样 N 条独立轨迹并选择步骤最少的轨迹。

如图 6 所示,在不同计算预算下,上下文管理通过扩展测试时计算量使模型获得显著性能提升,为执行额外步骤提供了更大空间。例如:

  • 摘要策略 将平均步骤数延长至 364 步,实现最高 60.2 的性能提升,但整体效率相对较低

  • 全弃置策略 虽然简单,却在效率与扩展性上表现俱佳,以 67.6 分达到与并行扩展相当的水平,且所用步骤数显著更少

总结而言,

  • 测试时计算可通过 上下文管理的串行扩展或并行扩展 来进行扩展,二者均能有效拓展模型的问题解决能力。
  • 然而不同策略在效率与扩展性上存在差异,因此在基准测试中考虑实际计算成本至关重要。
  • 未来工作的关键方向在于探寻串行与并行扩展的最优组合,以实现效率与扩展性的最大化平衡。

5. 结论与局限

本研究提出了 DeepSeek-V3.2 框架,该框架有效弥合了计算效率与高级推理能力之间的鸿沟。

  • 通过采用 DSA 机制,在不牺牲长上下文性能的前提下解决了关键的计算复杂度问题。
  • 通过增加计算资源投入,DeepSeek-V3.2 在推理基准测试中达到了与 GPT-5 相当的性能水平。
  • 此外,大规模智能体任务合成流程的集成显著提升了工具使用能力,为基于开源大语言模型的鲁棒且可泛化智能体开辟了新可能。
  • 特别值得关注的是,经国际数学奥林匹克竞赛与国际信息学奥林匹克竞赛金牌成绩验证的高计算变体 DeepSeek-V3.2-Speciale,为开源大语言模型的发展树立了新的里程碑。

尽管取得这些成就,仍需正视与 Gemini-3.0-Pro 等前沿闭源模型相比存在的若干局限:

  • 首先,由于训练总计算量相对较少,DeepSeek-V3.2 的世界知识广度仍落后于领先的专有模型,计划通过扩展预训练计算规模在后续版本中弥补这一知识差距;
  • 其次,token 有效性仍是亟待突破的挑战——DeepSeek-V3.2 通常需要更长的生成轨迹(即更多 token)才能达到 Gemini-3.0-Pro 等模型的输出质量,未来工作将聚焦于优化模型推理链的智能密度以提升效率;
  • 最后,在解决复杂任务方面仍与前沿模型存在差距,这将激励持续精进基础模型架构与后训练方案。
Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐