通义DeepResearch无需分块的原因:RAG在AI Agent领域的新变革
先从一个面试场景开始,尤其是简历上写了 DeepResearch 项目的同学,很可能被这么问:
面试官: 通义新出的那个 DeepResearch 有了解吗
答:DeepResearch 是阿里搞的一个 Agentic LLM 框架。它通过合成数据增量预训练 + 多阶段后训练,让模型在做复杂研究任务时的多步推理和工具调用能力变得超级强。
它有两种工作模式:
-
ReAct 模式: 就是基础的思考-行动-观察循环,走一步看一步。
-
IterResearch 模式: 这个是进阶版,能处理超复杂的任务。它会做多轮研究,每轮搞完还会写压缩笔记当成长期记忆,然后再开始下一轮。
整体目标就是让模型像个真正的研究员,自己会上网、会分析、会总结,最后给你一份报告。它的训练闭环是 Agentic CPT → SFT → RL,最后通过 on-policy 强化学习让模型自己卷自己,学会怎么更聪明地去推理。
面试官:为什么它不需要像传统 RAG那样做chunk呢?
答:DeepResearch 虽然用到了外部检索,但并不是传统意义上的 RAG。它没有预先 chunk 文档做 embedding,而是通过 agent 动态检索网页、筛选、摘要化再整合。
所以它是一个 Agentic RAG,核心在检索增强推理(Retrieval-Augmented Reasoning),而不是生成。检索只是它推理过程中的一个动作而已。
面试官:那你觉得,这种 Agent 架构未来会取代 RAG 吗?
答:我觉得不会完全取代,但是会融合。
长上下文(Long Context)让模型能读得更多,传统 RAG 让模型能读得准,而 DeepResearch 其实在验证一条新路:检索是模型自己行动的一部分,而不是一个外部的外挂模块。
未来的 Agent 框架,肯定都是在工具调用、动态检索、长记忆这三者之间找平衡。
好了,面试结束。我们现在来看看官方的技术报告,用大白话来说说它到底是怎么炼成一个SOTA的 Web Agent 的?
技术报告:https://tongyi-agent.github.io/zh/blog/introducing-tongyi-deep-research/
代码:https://github.com/Alibaba-NLP/DeepResearch
paper:https://arxiv.org/pdf/2510.24701
核心脉络是:一流的数据飞轮 + 两种推理模式 + 端到端的训练流程(CPT→SFT→RL)。
SOTA成绩与核心理念
DeepResearch 在好几个高难度基准(HLE, BrowseComp, xBench)上都拿了 SOTA,超过了所有开源和闭源的对手。
它的核心贡献是开源了一整套高水平 Agent 的构建方法论。
数据飞轮:无需人工标注的合成数据
DeepResearch 的数据来自两个阶段:
增量预训练(CPT)数据:打造强大的Agent基座
传统大模型(如 Qwen)虽然具备强大的语言理解与生成能力,但缺乏成为 Agent 所需的“思考—行动—反思”机制。它不知道何时调用工具,也无法基于上下文做出多步推理与决策。为解决这一问题,Tongyi 团队提出了数据合成系统 AgentFounder。
AgentFounder 基于多源知识(网页、知识图谱、工具调用结果、模型生成的轨迹数据等),自动构造出海量符合 Agent 思维逻辑的预训练样本。系统通过重组与问题构建,将知识片段转化为多风格的(问题,答案)对,模拟智能体在真实场景中的思维链与行动计划。例如:“为了回答问题 X,我需要先分析 Y,再执行 Z”。这样的数据使模型在预训练阶段就能接触到有目标、有步骤、有反馈的推理过程。
在此基础上,AgentFounder 进一步生成三类动作数据:
-
单步规划:解决局部子问题。
-
递进式推理:形成连续思考链。
-
多步决策:比较、评估多种方案并作出选择。
这种方法允许系统在离线环境中全面探索推理—行动空间,无需依赖外部 API,即可低成本获得高质量训练样本。核心思想是:让模型在预训练阶段就能学习决策链式样本,而非单次问答,从而增强推理稳定性与策略泛化能力。

图中上方灰色部分为传统语言模型的原始推理轨迹(Original Trajectory):模型从问题 Q 出发,依次生成推理步骤 S₁、S₂……Sₖ,最终得到结果 Rₖ。
下方黄色部分展示了 DeepResearch 的改进机制:
在每个推理步骤上,模型不再只生成一个结果,而是同时展开多个候选方案(Solution 1 / 2 / 3),再通过“选择—评估—判断”的方式形成新的决策路径。例如,模型会在某一步选择 Solution[2],并最终输出判断 “My decision is [Correct]”。
这种方法被称为 Step-level Scaling。模型在每个节点上多路径探索、逐步选择、自我校正,最终形成图中所示的 High-order Action Synthesis Trajectory。
本质上,这种机制让模型在预训练阶段就学会“多路径思考—逐步推理—自我评估”的模式,为后续的 SFT 与 RL 阶段提供了更稳定、更具策略性的智能体基座。
后训练(Post-training)数据:突破模型能力上限
增量预训练(CPT) 让模型具备了基本的推理与行动能力,但要让它成为真正的专家,必须通过高质量的后训练数据进行监督微调(SFT)来进一步提升。为此,DeepResearch 构建了端到端的自动化合成数据流程:
-
WebSailor / WebShaper: 他们基于知识图谱和形式化建模,能自动生成极其复杂的 Web QA 数据。
-
迭代复杂性升级 (Iterative Complexity Upgrading): 由一个 Agent 生成种子问题,再由另一个 Agent 借助检索、搜索和计算工具不断扩展与深化。每一轮输出都会成为下一轮输入,形成自演化的难度升级链,不断自我内卷,使问题逐步接近博士级研究任务。
-
融合两种轨迹: 最后,他们的数据里既包含了简单的 ReAct 轨迹,也包含了下面要讲的 IterResearch 轨迹,让模型见多识广。
两种Rollout模式:Agent如何思考
模型训练好了,怎么用?它提供了两种模式:
ReAct模式(基础版)
-
是什么: 就是经典的“思考-行动-观察”循环,严格遵守这个格式。
-
特点: 简单、通用。DeepResearch 在这个模式下(配上128K长上下文)表现已经很强了,这证明了他们前面数据飞轮和训练流程的有效性。
深度模式(Deep Mode)(SOTA进阶版)
传统 ReAct 在长任务中容易出现「认知瓶颈」和「噪声累积」——模型的上下文会不断膨胀,前面冗余的思考记录拖慢推理节奏。为此,DeepResearch 引入了 IterResearch 范式,让智能体能够在多轮循环中持续聚焦核心信息、清理无效上下文。
核心机制:IterResearch
IterResearch 是 DeepResearch 的核心创新。它将一个复杂研究任务拆解为多个「研究回合(Research Rounds)」,每一回合都包括:
-
思考与行动(Think & Act):Agent 执行一次推理或工具调用;
-
综合与重构(Synthesis & Reconstruction):回合结束时,模型不会保留全部历史思维,而是提炼出关键信息,生成一份「核心报告(Report)」;
-
清洁工作空间(Clean Workspace):模型以这份报告为唯一输入,开启下一轮推理,从而避免冗余积累。
如下图所示,IterResearch 在每一轮结束后会清空旧上下文,只保留压缩后的核心信息(Central Memory),并在新的精简工作空间中继续推理。
如果当前行动(Action)是工具调用,模型会通过环境(Environment ε,如 Search、Scholar、Browsing、Python)获取结果并更新工作区;如果是生成答案,则直接进入综合阶段。这种循环形成了一个持续优化的「高质量思维链」,既能防止噪声污染,又能维持推理一致性。
效果:
每一次迭代都让 Agent 的大脑保持清晰与紧凑,从而支持超长任务的稳定推理。这种机制是 DeepResearch 获得 SOTA性能的关键。

端到端Agent训练流程(CPT → SFT → RL)
前面讲了数据和用法,现在讲怎么训练。
On-Policy强化学习(RL)
SFT 只能让模型模仿专家,RL 才能让模型超越专家。
-
算法: 他们用了 On-Policy 策略(基于 GRPO 定制优化),确保模型学到的是自己当前能力最匹配的信号。
-
关键优化:
-
留一法 (Leave-one-out):在优势估计(advantage estimation)时,去掉当前样本在批次中的贡献,降低方差,让梯度更稳定。
-
过滤负样本(Trajectory Filtering): 训练中发现,如果把格式错误、过长或失败的轨迹也算作负样本,会导致梯度震荡甚至崩溃。
-
因此,DeepResearch 选择性地丢弃低质量轨迹,只保留对学习稳定性有贡献的样本。

图中的强化学习系统由四个核心模块组成:
-
Async Rollout Service:异步生成模型的行为轨迹;
-
Rollout Worker:与环境交互,收集模型的行动—反馈;
-
Reward Service:对轨迹进行打分,生成奖励信号;
-
Automatic Synthetic Data:高质量轨迹会被保留,用于后续再训练。
在交互环境中,Agent 可同时访问真实任务环境(如网页搜索、学术检索、Python 执行)与模拟环境,从而形成闭环强化学习循环。 这种异步收集 + 筛选优化的机制,有效提高了训练效率与奖励稳定性,防止格式崩溃(format collapse)并提升泛化能力。
基础设施(保证RL能跑起来)
-
仿真训练环境: RL 不能真的去实时联网训练(又贵又慢又不稳定)。他们用离线维基百科和自定义工具搞了个模拟环境,让 Agent 在里面低成本、高效率地刷副本。
-
稳定沙盒: 确保工具调用(如搜索)有缓存、能重试,不会因为网络波动导致 Agent 训练崩溃。
-
自动数据管理: 这就呼应了最开始的数据飞轮,RL 过程中产生的新数据,会反哺回数据池,动态优化训练集。
-
On‑Policy策略的异步框架:在 rLLM 之上实现了异步强化学习训练推理框架,多个智能体实例并行与(模拟或真实)环境交互,独立生成轨迹。
应用与总结
最后,通义DeepResearch已经在高德地图(地图导航 Agent)和通义法睿(法律 Agent)中落地。
总结一下
DeepResearch 之所以不需要传统 RAG 的Chunking,是因为它从根本上改变了范式。
-
传统 RAG 是一个静态系统,模型是被动缝合你喂给它的碎纸片 (Chunks)。
-
DeepResearch 是一个动态系统。模型是研究员,它主动去获取完整的信息(网页/文档),然后利用IterResearch范式(压缩笔记)来管理自己的认知焦点,再利用RL来优化自己的研究策略。
所以,RAG 不会被取代,而是正在被 DeepResearch 这样的 Agent 框架吸收和升维——检索不再是一个外部模块,而是 Agent 工具箱里一个最基础的动作而已。
最后
我在一线科技企业深耕十二载,见证过太多因技术卡位而跃迁的案例。那些率先拥抱 AI 的同事,早已在效率与薪资上形成代际优势,我意识到有很多经验和知识值得分享给大家,也可以通过我们的能力和经验解答大家在大模型的学习中的很多困惑。
我整理出这套 AI 大模型突围资料包:
- ✅AI大模型学习路线图
- ✅Agent行业报告
- ✅100集大模型视频教程
- ✅大模型书籍PDF
- ✅DeepSeek教程
- ✅AI产品经理入门资料
如果你也想通过学大模型技术去帮助自己升职和加薪,可以扫描下方链接👇👇

为什么我要说现在普通人就业/升职加薪的首选是AI大模型?
人工智能技术的爆发式增长,正以不可逆转之势重塑就业市场版图。从DeepSeek等国产大模型引发的科技圈热议,到全国两会关于AI产业发展的政策聚焦,再到招聘会上排起的长队,AI的热度已从技术领域渗透到就业市场的每一个角落。

智联招聘的最新数据给出了最直观的印证:2025年2月,AI领域求职人数同比增幅突破200% ,远超其他行业平均水平;整个人工智能行业的求职增速达到33.4%,位居各行业榜首,其中人工智能工程师岗位的求职热度更是飙升69.6%。
AI产业的快速扩张,也让人才供需矛盾愈发突出。麦肯锡报告明确预测,到2030年中国AI专业人才需求将达600万人,人才缺口可能高达400万人,这一缺口不仅存在于核心技术领域,更蔓延至产业应用的各个环节。


资料包有什么?
①从入门到精通的全套视频教程
包含提示词工程、RAG、Agent等技术点

② AI大模型学习路线图(还有视频解说)
全过程AI大模型学习路线

③学习电子书籍和技术文档
市面上的大模型书籍确实太多了,这些是我精选出来的

④各大厂大模型面试题目详解

⑤ 这些资料真的有用吗?
这份资料由我和鲁为民博士共同整理,鲁为民博士先后获得了北京清华大学学士和美国加州理工学院博士学位,在包括IEEE Transactions等学术期刊和诸多国际会议上发表了超过50篇学术论文、取得了多项美国和中国发明专利,同时还斩获了吴文俊人工智能科学技术奖。目前我正在和鲁博士共同进行人工智能的研究。
所有的视频教程由智泊AI老师录制,且资料与智泊AI共享,相互补充。这份学习大礼包应该算是现在最全面的大模型学习资料了。
资料内容涵盖了从入门到进阶的各类视频教程和实战项目,无论你是小白还是有些技术基础的,这份资料都绝对能帮助你提升薪资待遇,转行大模型岗位。


智泊AI始终秉持着“让每个人平等享受到优质教育资源”的育人理念,通过动态追踪大模型开发、数据标注伦理等前沿技术趋势,构建起"前沿课程+智能实训+精准就业"的高效培养体系。
课堂上不光教理论,还带着学员做了十多个真实项目。学员要亲自上手搞数据清洗、模型调优这些硬核操作,把课本知识变成真本事!


如果说你是以下人群中的其中一类,都可以来智泊AI学习人工智能,找到高薪工作,一次小小的“投资”换来的是终身受益!
应届毕业生:无工作经验但想要系统学习AI大模型技术,期待通过实战项目掌握核心技术。
零基础转型:非技术背景但关注AI应用场景,计划通过低代码工具实现“AI+行业”跨界。
业务赋能 突破瓶颈:传统开发者(Java/前端等)学习Transformer架构与LangChain框架,向AI全栈工程师转型。
👉获取方式:
😝有需要的小伙伴,可以保存图片到wx扫描二v码免费领取【保证100%免费】🆓

更多推荐


所有评论(0)