文章介绍了SkillHone和SGDR两篇论文,提出了解决Agent技能管理问题的方法。SkillHone通过持久决策历史记录技能修改过程,避免重复试错和盲目回滚;SGDR则通过状态锚定动态检索,让Agent在执行过程中动态适配技能。这些方法让Agent的技能不再是静态工具,而是持续进化的活资产,从而提升AI的智能化水平。

当给 Agent 配了一套Skill技能,第一天好用,第二周 API 变了,第三个月任务也变了,技能就废了。更尴尬的是——你想修,却不知道上次为什么改成这样、哪些方案被否过、修完会不会倒退。

图片图片

这就是今天 Agent Skill 技能管理的现实:技能是"死"的,做完就扔,下次又从零开始。两篇来自腾讯系的论文——SkillHone 和SGDR——说不用这样,技能可以"活"起来。

图片

SkillHone:给技能进化装上记忆

SkillHone 动机示意:没有决策历史时后续优化会重复旧修复或倒退图片

SkillHone 的核心设计是持久决策历史(Persistent Decision History)。每次技能修改,都记录一个四元组:诊断、候选修订、评估证据、结果。后来者能看到"上次为什么改"“什么方案被否了”“评估怎么说的”。

这比普通的版本 diff 更有用——diff 只告诉你文件怎么变了,决策历史告诉你为什么变、靠什么判断的、变完效果如何。环境变了的时候,后续 Agent 可以查阅历史,判断某个失败是不是新问题、某个修复以前试过没、某个替代方案为什么被拒绝。

SkillHone 架构:优化端和评估端角色隔离,决策历史贯穿多轮迭代

SkillHone 架构:优化端和评估端角色隔离,决策历史贯穿多轮迭代

同时 SkillHone 用角色隔离机制防止"背答案":优化子 Agent 只看脱敏报告,不能碰测试题和评分器;评估子 Agent 跑测试但不能碰技能库。两边的权限边界是结构性的,不是靠提示词约束的。Table 2 列出了 9 种子 Agent 派发模式,每种都有明确的权限边界。

9 种子 Agent 派发模式

9 种子 Agent 派发模式

另外一个关键设计:当技能修改导致性能倒退时,SkillHone 不是整个回滚,而是定向修复出问题的那部分改动,保留其余有用的编辑。

整体效果

整体效果

这和 Hermes-SE 的"整接受/整拒绝"形成对比——Figure 3 的优化轨迹清晰展示了差异:SkillHone 从 30% 一路涨到 70%,中间两次倒退都被定向修复回来。

SkillHone vs Hermes-SE 优化轨迹对比

SkillHone vs Hermes-SE 优化轨迹对比

SGDR:走到哪,技能配到哪

图片

SGDR 解决的是另一个维度的问题——执行过程中技能该怎么用。

传统做法是任务开始时检索一次技能,全程不变。SGDR 改成每一步决策都重新检索,而且检索时同时看两个信号:任务目标(你要干什么)和当前网页状态(你现在在哪)。公式很简单:检索分数 = α × 任务相关性 + (1-α) × 状态相关性,消融实验证实 α=0.5 效果最好。

图片

技能从哪来?SGDR 用滑动窗口从已完成的成功轨迹中抽取子技能——窗口长度覆盖 2 到 5 个动作,不长不短,刚好适配中间执行状态。每个技能用文本-代码对表示:自然语言描述负责检索匹配,可执行代码负责直接调用。

检索出来还要用 MMR 去重,因为相邻窗口抽出的技能可能高度重复。消融实验证明 MMR(λ=0.7)比简单取 Top-M 一致更好,鼓励多样性。

SGDR 方法总览:滑动窗口提取 + 状态锚定动态检索 + MMR 去重

SGDR 方法总览:滑动窗口提取 + 状态锚定动态检索 + MMR 去重

进化后的技能打掉了商业搜索 Agent

SkillHone 的实验在 deep-research 场景下,用 Qwen3.6-35B-A3B 作为评测模型——注意,这不是一个顶级大模型。但进化后的技能让它在 GAIA 上拿到 64.6%,超过配了商业搜索服务的 deep-research agent 15.8 分;WebWalkerQA-EN 上 66.4%,超过 3.2 分。

对比其他技能进化方法更夸张:比 Skill-Creator 在 GAIA 上高 20.5 分,比 Hermes-SE 高 14.2 分。

SkillHone 主结果表

SkillHone 主结果表

SGDR 在 WebArena 五个域上,GPT-4.1 backbone 达到 37.5% 平均成功率,相对最强基线 CER 提升 10.6%;用 Qwen3-4B 也达到 24.3%,相对提升 10.0%。步骤效率也更高:平均 4.8 步完成任务,而 Vanilla 要 6.0 步,CER 要 6.4 步——一个技能包可以执行包含多个原始动作的子流程,所以步数反而更少。

SGDR 累积成功率随任务流增长始终领先基线

SGDR 累积成功率随任务流增长始终领先基线

这意味着什么

两篇论文共同指向一件事:Agent 的技能不该是静态工具,而是持续进化的活资产。

SkillHone 解决的是"跨会话怎么不丢经验"——给技能进化装上记忆,让每次修改都有据可查,避免重复试错和盲目回滚。SGDR 解决的是"单次执行中怎么动态适配"——让 Agent 每一步都找到当下最需要的技能,而不是开头一次配齐然后硬扛到底。

最后

如果说程序员已经是高薪职业,那么干AI的程序员,就是高薪中的高薪。

图片

现在的市场,已经用数据给程序员指明了方向:学AI大模型,就是冲刺高薪的最优解!

图片

看着身边越来越多的同行转型大模型、拿到高薪offer,很多人心里都动了心,但真正的难题来了:零基础小白不知道从哪入门?有基础的程序员找不到系统学习路径?实战项目练手无门?面试不知道考什么?

别慌!今天就给大家整理了一份【2026年最新版】AI大模型免费学习资源包,覆盖从入门到实战、从理论到面试、从基础到进阶的全流程,所有资料均已整理归档,无冗余、无套路,免费分享给每一位想抓住AI风口的程序员和小白!

👇👇扫码免费领取全部内容👇👇

在这里插入图片描述

1、大模型系统化学习路线

在这里插入图片描述

2、大模型学习书籍&文档

在这里插入图片描述

3、AI大模型最新行业报告

在这里插入图片描述

4、大模型项目实战&配套源码

img

5、大模型大厂面试真题

img

四阶段精细化学习规划(附时间节点,可直接照做)

结合上述资源,给大家整理了一份可直接落地的四阶段学习规划,总时长约2个月,小白可循序渐进,程序员可根据自身基础调整节奏,高效掌握大模型核心能力,快速实现从“入门”到“能落地、能面试”的跨越。

第一阶段(10天):初阶应用

该阶段让大家对大模型 AI有一个最前沿的认识,对大模型 AI 的理解超过 95% 的人,可以在相关讨论时发表高级、不跟风、又接地气的见解,别人只会和 AI 聊天,而你能调教 AI,并能用代码将大模型和业务衔接。

  • 大模型 AI 能干什么?
  • 大模型是怎样获得「智能」的?
  • 用好 AI 的核心心法
  • 大模型应用业务架构
  • 大模型应用技术架构
  • 代码示例:向 GPT-3.5 灌入新知识
  • 提示工程的意义和核心思想
  • Prompt 典型构成
  • 指令调优方法论
  • 思维链和思维树
  • Prompt 攻击和防范
第二阶段(30天):高阶应用

该阶段我们正式进入大模型 AI 进阶实战学习,学会构造私有知识库,扩展 AI 的能力。快速开发一个完整的基于 agent 对话机器人。掌握功能最强的大模型开发框架,抓住最新的技术进展,适合 Python 和 JavaScript 程序员。

  • 为什么要做 RAG
  • 搭建一个简单的 ChatPDF
  • 检索的基础概念
  • 什么是向量表示(Embeddings)
  • 向量数据库与向量检索
  • 基于向量检索的 RAG
  • 搭建 RAG 系统的扩展知识
  • 混合检索与 RAG-Fusion 简介
  • 向量模型本地部署
第三阶段(30天):模型训练

恭喜你,如果学到这里,你基本可以找到一份大模型 AI相关的工作,自己也能训练 GPT 了!通过微调,训练自己的垂直大模型,能独立训练开源多模态大模型,掌握更多技术方案。

到此为止,大概2个月的时间。你已经成为了一名“AI小子”。那么你还想往下探索吗?

  • 为什么要做 RAG
  • 什么是模型
  • 什么是模型训练
  • 求解器 & 损失函数简介
  • 小实验2:手写一个简单的神经网络并训练它
  • 什么是训练/预训练/微调/轻量化微调
  • Transformer结构简介
  • 轻量化微调
  • 实验数据集的构建
第四阶段(20天):商业闭环

对全球大模型从性能、吞吐量、成本等方面有一定的认知,可以在云端和本地等多种环境下部署大模型,找到适合自己的项目/创业方向,做一名被 AI 武装的产品经理。

  • 硬件选型
  • 带你了解全球大模型
  • 使用国产大模型服务
  • 搭建 OpenAI 代理
  • 热身:基于阿里云 PAI 部署 Stable Diffusion
  • 在本地计算机运行大模型
  • 大模型的私有化部署
  • 基于 vLLM 部署大模型
  • 案例:如何优雅地在阿里云私有部署开源大模型
  • 部署一套开源 LLM 项目
  • 内容安全
  • 互联网信息服务算法备案

👇👇扫码免费领取全部内容👇👇

在这里插入图片描述

6、这些资料真的有用吗?

这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理,现任上海殷泊信息科技CEO,其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证,服务航天科工、国家电网等1000+企业,以第一作者在IEEE Transactions发表论文50+篇,获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。

资料内容涵盖了从入门到进阶的各类视频教程和实战项目,无论你是小白还是有些技术基础的技术人员,这份资料都绝对能帮助你提升薪资待遇,转行大模型岗位。
在这里插入图片描述
在这里插入图片描述

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费

在这里插入图片描述

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐