北大2篇Skill炸场,Agent彻底进化
一个 Agent 到底凭什么越来越强?有人靠更大的模型,有人靠更多数据,但北京大学连发两篇论文,给出了同一条答案:让 Skill 自己进化。

这两篇都来自北大,一个叫 VeriSkill,管程序验证;一个叫 SESA,管搜索问答自博弈。方向不同,内核却高度一致——它们都不把Skill当成静态的、靠人手写的说明书,而是当成一个会从失败里自我更新的活记忆。

第一篇Self-Play Meets Skill Evolution由中科院,中科大,北大,清华等联合发表,Skill这块清华也很高产
SESA:自博弈遇上进化Skill
SESA 面对的是另一类 Agent——工具增强的搜索问答。自博弈能让 Agent 自己出题自己解,但失败只贡献一个梯度,不留持久状态;外部Skill记忆又只从固定任务分布学。两边的毛病正好镜像:自博弈会练但会忘,Skill记忆会记但不会选题。SESA 把过程记忆变成自博弈的进化状态,用四个阶段闭环。

SESA 概念总览
一是记忆启动,用 15 条手写加 142 条 bootstrap 挖出的技能,共 157 条打底。二是不对称自博弈,challenger 出题、solver 解题,只有 solver 能检索技能,防止解题策略泄漏给出题方。三是前沿塑形,用钟形奖励把出题方推向 solver 能力边界附近的问题,太简单太难的都罚,保证失败是可学的。四是失败蒸馏,把有用的失败提炼成技能写回记忆,去重、按 help-hurt 淘汰、上限 800 条。

SESA 训练环
这个闭环的关键在于双向耦合:技能更新改变 solver 行为,solver 变强又改变 challenger 的奖励和未来题目分布,新题目再制造新失败、改写记忆。任务生成和技能记忆一起进化。
因为技能参与了训练轨迹,SESA 支持双路复用。最反直觉的结论来自关掉记忆的 SESA-Off:即便推理时不检索任何技能,训练过的 solver 相对 SSP 仍有 +1.8(Qwen3-4B)和 +2.2(Qwen3-8B) 的提升。也就是说技能不是推理时的小技巧,而是真的把能力烧进了模型参数;再把记忆开回来,还能再加 0.5 到 1.0 个点。

总体看,七个问答基准上 SESA 平均超过 SSP 1.2 到 3.2 个点,相对原始模型提升 7.0 到 11.8 个点,且跨 Qwen3、Qwen2.5、LLaMA-3.1、Search-R1 多个底座都成立。消融里失败蒸馏贡献最大,去掉掉 2.7 个点;前沿塑形掉 2.2;记忆启动掉 1.5。对比已发布的 SkillRL,SESA 以 51.0 对 50.1 领先 0.9 个点。

训练动力学也印证了设计:验证质量稳步上升后稳定,活跃技能数先膨胀、后因去重和淘汰收缩——是会自我精炼的记忆,而不是无限堆积。

自进化动力学
VeriSkill:让验证失败变成可信的Skill更新

程序验证是要证明一段代码满足形式化规范,靠 Dafny、Frama-C、VeriFast 这类验证器。LLM Agent 想全自动完成它,离不开可复用技能。但验证器的反馈是失败的验证条件,又晦涩又不直接可用。VeriSkill 用三步把这种废信号变成可信更新。

VeriSkill 总体框架
第一步是责任归因。它把每次失败分成四类:任务不可满足、证明器能力不足、技能不合规、技能知识缺口。前两类跟技能无关,直接丢掉;只留后两类作为进化信号。这一步挡住了最大的噪声来源。
第二步是教训抽象。不为单个例子打补丁,而是抽诊断签名——失败在哪、缺什么职责、技能文本怎么导致的失败——把同模式失败聚类,再抽象成一条可复用 lesson,并删掉实例细节,避免把某个具体答案硬编码进技能。
第三步是可执行验证。候选技能要在归因集和同模式迁移集上反复跑验证器,只有严格提升验证成功率、且不破坏原程序语义,才准许进入技能库。所有结果写进进化记忆,指导下一轮。

结果很硬。在三个验证器、两套 Agent 配置下,VeriSkill六项全胜。相对无技能基线,Dafny 提升 +43.3、Frama-C +17.6、VeriFast +46.0 个百分点(Claude Code / Opus 4.8);换到 Codex / GPT 5.6 下,VeriFast 直接 +51.3。即便对比最强的同类基线 SkillOpt-Lite,它仍分别领先 +15.0、+9.1、+5.7。

消融实验说明三步缺一不可,且可执行验证贡献最大:去掉它,PASS 从 57.3 掉到 36.0,跌 21.3;去掉责任归因跌 13.0;去掉教训抽象跌 8.3。

更值得在意的是迁移性。用 Codex 进化出的技能,原封不动塞给 Terminus 框架下别的模型,依然带来 +15.3 到 +43.7 个百分点的提升。这说明 VeriSkill 提炼的是可复用知识,不是某个模型专属的 prompt 玄学。

跨模型迁移性
两篇合在一起,说明了一件事
VeriSkill 和 SESA 场景差很远,一个在形式化验证的硬骨头里,一个在开放域搜索的自博弈里。但它们指向同一个判断:Skill 不该是人手维护的死库,而该是会从失败中自我进化的活记忆。
对做 Agent 的人来说,这意味着别再把精力全砸在 prompt 和模型规模上。把失败变成可复用、可验证、会自我更新的技能记忆,才是 Agent 能持续变强的底层逻辑。北大这两篇,把这条路铺得相当扎实。
学AI大模型的正确顺序,千万不要搞错了
🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!
有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!
就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇
学习路线:
✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经
以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!
我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~
这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

更多推荐
所有评论(0)