LLM Agent的自进化方法研究综述
一、Agent自进化RSI简述
Agent自进化(RSI)已成为LLM Agent在垂直领域可靠落地的最热门前沿课题之一,其核心思路是让Agent在运行过程中不断自我修正,做到越用越好、越用越聪明。目前,行业共识正从投入巨资打造全能行业模型,转向推动通用模型在具体场景中持续自我进化。
自我修正的核心方法论可以概括为一句话:不只看结果,更要看过程。具体来说,就是充分利用以下三类信息源:
- 执行过程轨迹:Agent在完成任务过程中的每一步推理、每一次工具调用、每一个中间状态,构成了丰富的“过程数据”。这些轨迹中隐藏着比最终结果更丰富的信息——成功的步骤可复用,失败的步骤可标记和规避。
- 历史记忆:跨任务、跨时间积累的经验库,包括过去的成功案例、失败教训、环境认知等,让Agent不必每次从零开始。
- 人工参与的反馈:领域专家对Agent行为的纠正、评价和引导。在金融等专业领域,人类专家的经验和直觉仍然是不可替代的稀缺资源,将这些隐性知识显性化是Agent进化的重要推力。
从这些信息中抽取出有效且明确的信号(即“显性信噪”)后,有两条核心的固化路径:
- 参数固化(训练路径):将经验通过后训练内化到模型参数中。优点是模型推理时无需外部依赖,经验已成为模型“本能”;缺点是训练成本高、迭代周期长。
- 外挂固化(非训练路径):将经验沉淀为外挂Harness的上下文、记忆或可复用技能(Skill)。优点是灵活轻量、可快速迭代;缺点是依赖检索和上下文窗口。
两条路径并非互斥,而是协同进步的:外挂记忆和技能库的不断积累,为下一轮参数固化提供了高质量训练数据来源;而参数能力的提升,又让Agent能更高效地利用外挂知识。这种“参数-外挂”双循环协同进化模式,构成了Agent自进化体系的核心架构。
二、代表性方法探研
当前Agent自进化方向上涌现了大量研究。按照是否进行模型参数更新,可大致分为“训练”与“非训练”两大类。以下选择五篇代表性论文进行简要介绍,分别代表了这两类路径的前沿探索。
1. SEED:自我演化的在线策略蒸馏(训练类)
SEED(Self-Evolving On-Policy Distillation)来自清华大学等机构,解决的核心问题是:强化学习训练Agent时,往往只在任务结束后给一个“成功/失败”的笼统奖励,Agent根本不知道自己几十个动作里哪个做对了、哪个做错了——就像老师只告诉你期末考试及格与否,却不告诉你哪道题错了。
SEED的核心思路可以用一句话概括:让AI做自己的私教。具体做法分为两步:
第一步,先用强模型(如GLM-5.2)微调教会待优化模型“事后复盘”的能力。对一批历史轨迹写“事后总结”——成功的总结套路,失败的总结教训,然后让待优化模型学着写这种总结。
第二步则是精髓——让模型边训练边自我复盘边内化。每次训练时:先用当前模型跑一批任务得到轨迹;然后让同一个模型“换个身份”当分析员,回头看自己的轨迹,提炼出“事后技能”;关键的一步——把同一批动作样本放在两个不同背景下重新打分:一个版本给模型看事后技能(当“老师”),另一个不给看(当“学生”)。两个版本的打分差距,就是该动作“该不该做”的精细信号,被摊到轨迹中每一个token上作为稠密学习损失,并与GRPO的环境奖励损失结合,一起优化模型。
最妙的设计是:事后技能只在训练时当“私教”,推理时完全消失,所有经验已被“吃进”模型参数里。模型越训越强后,既能跑得更好、复盘也复得更好,两者手拉手一起进化——这就是“自演化”的精髓。消融实验还发现:用静态经验库替代“自己当下跑出来的经验”,掉分最狠,恰说明on-policy的自演化才是这套方法的命根子。
2. LLM-as-a-Coach:体验式学习的教练模型(训练类)
LLM-as-a-Coach来自微软研究院,提出了“体验式学习”(Experiential Learning, EL)框架。传统RL用评估模型(Judge)给答案打分,只输出一个标量分数,但评估过程中产生的大量文本分析被全部丢弃了。这就是信息瓶颈:两个答案同样得7分,但一个逻辑更强、一个文笔更好,优化器无从区分。
EL的核心创新是把评估模型从“裁判”升级为“教练”。教练的产出不只是一个分数,而是一段“可迁移的经验知识”——通用的、可复用在类似任务上的改进建议。该框架涉及三类模型:策略模型(优化对象,中小规模)、评估模型(越强越好,必然优于策略模型)、教师模型(策略模型的初始冻结副本)。训练时,将经验知识作为额外上下文输入教师模型,教师与策略模型对同一回答分别计算每个位置下一个token的概率分布,然后计算两个分布的反向KL散度作为损失,让策略分布向教师靠拢。
这段经验知识的信息量是标量奖励的数千倍,能提供远超分数的稠密监督信号。实验显示,EL在开放式任务上一致优于基于评分的RL,泛化性更好,不易出现“刷分”(reward hacking)。但EL也有局限:Coach模型质量决定上限,错误放大比RL更严重;反复迭代会导致基础指令遵循能力下降;训练成本大幅增加,且经验提取有效性依赖Prompt工程。
3. RHI:递归式Harness自改进(非训练类)
RHI(Recursive Harness Self-Improvement)来自Sakana AI和UC Berkeley,聚焦于多Agent协同场景。现在很多复杂编码任务不是单个模型独立完成的,而是一群Agent分工合作。这套分工协作的“规矩”,行话叫Harness(编排层/外壳层),包含角色(role)、工作流(workflow)、信息契约(contract)、执行步(hop)等组件。厂商给的通用Harness模板往往不够好用,而用户自己写一套特化规矩又太难。
RHI的思路是让这套规矩自己进化。具体做法是一个四步循环:用当前Harness跑一遍任务生成代码仓库;找个裁判对比本次结果和上次结果,判输赢;把历次输赢记录攒起来当“势头”参考;让一个“Harness优化器”AI看着历史记录,把规矩文本改一版,进入下一轮。
这里有两个巧妙的设计。第一,只跟昨天的自己比,不搞多方案PK——以前的方法搞一堆候选互相竞争,成本是平方级别。RHI只跟前一轮比,单次信号虽噪,但攒成历史就很稳,成本从平方降到常数。第二,评判标准不直接告诉“改规矩的AI”,优化器只看裁判的输赢记录,RHI是隐式地往评估标准靠,而不是直接拿奖励信号去最大化——这反而更稳。此外,Harness写成文本prompt而非代码,让任何闭源的coding agent都能用。
实验效果令人惊讶:Claude Sonnet配RHI打败了同模型开最大推理强度的版本;Opus配RHI连官方最强的ultracode都打不过它,且推理成本降60%。而且输出token数基本不变——增益不是来自“想得更久”,而是来自“配合得更好”。论文还提出了一个信息论假设来解释RHI的隐含优化目标:让组件跟任务更相关(加法项),让组件之间少重复(减法项)——既要更懂活儿,又要不啰嗦。核心洞察是:真正决定多Agent效率的不是每个Agent的思考量,而是Agent之间的信息流。
4. MCSE:从记忆到技能的证据驱动协同进化(非训练类)
MCSE(Memory-Skill Co-Evolution)来自MemTensor和中国科学技术大学等机构,解决的核心问题是:现有Agent的记忆系统大多是“被动检索”——把过去的交互记录原样塞回上下文窗口让Agent重新推理,既费Token又容易抓错重点。即便一个Agent装了十次插件、找了十次测试文件,第十一次还是从头摸索。
MCSE构建了三级记忆层级:
- L1轨迹记忆:每一步的(状态、动作、观察、自我反思、价值),不存原始观察只存归一化证据,是最底层的“证据卡片”,所有高层抽象都必须能追溯到L1。
- L2策略记忆:从跨回合轨迹中归纳出的可复用“套路”——触发条件、步骤、验证规则、适用边界。
- L3环境认知:抽象出“这个环境长什么样”——如目录结构、包管理器类型、系统约束等声明式知识。
关键设计是技能结晶的门控机制:一个L2策略要“晋升”成技能卡,需过两道关——一是确实有正收益(用了它成功率更高),二是近期表现稳定(不是偶尔蒙对)。过关后结晶成一张“技能卡”,带有触发条件、执行过程、验证规则、适用边界、证据出处、决策指引(含反模式)、可靠性评分。技能还有生命周期管理:试用→活跃→归档,用砸了就降级。
MCSE另一个巧妙设计是“反思加权价值回填”:Agent每一步都写一句自我反思,然后用LLM给反思的靠谱程度打分——反思越实在、越跟结果因果相关,权重越高。最后用这个权重把终端成功/失败的反馈“倒推”分摊到每一步,得到每一步的精细价值。实验中,MCSE在EvoAgentBench五个领域Pass@1均第一,且展现出跨域迁移能力和终身进化特征。
5. AgentBrew:强师出高徒的知识酿造(非训练类)
AgentBrew来自香港大学,解决了一个非常实际的部署场景:训练期能用强模型(Teacher),但生产环境只能跑弱模型(Student),且不能更新弱模型参数。环境只给二元反馈(通过/失败),没有专家示范轨迹。
AgentBrew提出了一套“酿造-服务”框架。酿造阶段:当弱模型执行任务失败时(成功则不需要介入),强模型介入分析失败轨迹。关键创新是“学生感知”——强模型必须站在弱模型的认知水平上去写操作指南,颗粒度校准到弱模型:强模型认为“显然”的推理步骤必须拆开写清楚,概念用弱模型熟悉的词汇表达,操作具体到弱模型可直接执行的颗粒度。
然后通过“Ralph循环”验证:将候选笔记塞回弱模型,让它在同一任务上重跑——只有确实帮助弱模型从失败翻转为成功,这条笔记才算“酿造成功”,存入外部记忆库。服务阶段:弱模型推理时从冻结的记忆库中检索Top-K笔记拼入prompt,全程不需要强模型参与,也不需要更新参数。实验显示,弱模型加酿造后只跑一次就追平甚至超过Reflexion的多次反思;在Terminal-Bench真实任务上,弱模型加酿造能以三分之二的API成本取得比强模型更高的通过率——知识的“可执行性”比“深度”更重要。
三、LLM Agent自进化方法总结
综合以上五篇代表性工作,可以提炼出Agent自进化方法的几个核心共识:
第一,从“黑盒优化”到“白盒学习”。所有方法的总体思路,都是不只看结果黑盒优化,而是从推理决策过程轨迹和人类反馈中,在低信噪比的情况下,用各种方法抽取出显性信噪。SEED通过on-policy事后总结、LLM-as-a-Coach通过教练经验知识、RHI通过递归历史对比、MCSE通过反思加权价值回填、AgentBrew通过结构化笔记,都在打开这个黑盒。即便环境反馈本身稀疏且嘌杂,通过对过程轨迹的精细分析和人类反馈的校准,仍可以提炼出高质量的监督信号。
第二,两种固化路径并行发展。这些显性信噪要么进行模型参数(后训练),要么进行harness上下文,要么沉淀为记忆与技能。训练路径(SEED、LLM-as-a-Coach)将经验内化到模型参数中,推理时无需外部依赖;非训练路径(RHI、MCSE、AgentBrew)将经验外挂到Harness上下文、结构化记忆或技能中,灵活轻量。两条路径并非对立,而是互补:外挂经验的持续积累为参数固化提供了高质量训练数据,参数能力的提升又让Agent更高效地利用外挂知识。
第三,On-Policy与Off-Policy各有侧重。On-Policy方法(如SEED强调的“自己当下跑出来的经验”)重视本次执行与自身经验,确保学习信号与当前策略分布一致。Off-Policy方法(如AgentBrew的跨任务记忆库、MCSE的跨回合策略归纳)重视历史与别人经验的迁移,让Agent站在更宏大的经验基础上。实践中,两者结合——既有即时反思又有历史积淀——往往效果最好。
第四,从“记忆”到“技能”的范式升级。记忆不应只是被动检索的“日记本”,而应被组织成可执行、可验证、可进化的“技能”。这一思路贯穿了几乎所有方法:SEED的“事后技能”、RHI的“优化后的Harness”、AgentBrew的“结构化笔记”——本质上都是将原始经验转化为可复用知识单元。
四、展望:Agent自进化与领域数字孪生
纵观当前的技术格局,LLM与Agent在产业垂直领域真正释放产能,目前看来有两条最为关键的技术方向,两者互为支撑、缺一不可:
第一个方向是Agent自进化。它解决的是“模型如何越用越好”的问题。通过从执行轨迹、历史记忆和人类反馈中持续萃取高质量信号,让Agent的能力随使用而增长,形成正向飞轮。它让产业应用不再依赖“等待下一个更强的基础模型发布”,而是让现有模型在实战中自我成长。
第二个方向是领域数字孪生(许多人称之为“本体”)。它解决的是“领域知识如何被模型高效理解和利用”的问题。产业垂直领域积累了海量结构化与非结构化知识,但这些知识的组织形式通常面向人类阅读,而非面向模型推理。将其以LLM-friendly的方式重构为语义结构(如知识图谱、本体模型),可以大幅提升Agent在领域内的理解和推理效率。如果说Agent自进化解决的是“学习能力”,那么领域数字孪生解决的就是“学习素材”。
相信,这两大方向的深度结合,将大幅度推进LLM与Agent在金融、医疗、法律、制造等产业垂直领域的产能释放。当模型既拥有结构化的领域知识底座,又具备在实践中不断自我修正的能力,“AI赋能产业”才能真正从概念走向现实。
更多推荐


所有评论(0)