摘要:很多人给 Agent 装 Skill 的策略是"多多益善"——看到好用的就装,几周下来挂了几十个,以为越多越强。但最近一篇研究论文用实验数据给出了完全相反的结论:2-3 个精炼的 Skill 能提升 18.6% 的表现,一旦超过 4 个,效果骤降到 5.9%;而让 AI 自己生成 Skill 来辅助自己,效果居然是负的。本文从这篇论文的核心发现出发,结合 Skill 的调用机制和社区讨论,分析为什么"少而精"才是 Agent Skill 的正确打开方式,以及如何在 50,000+ 的 Skill 市场里找到那 2-3 个真正值得装的。

适用人群:正在使用 Agent(Claude Code / Cursor / CatPaw 等)的开发者,关注 AI Agent 能力增强和 Skill 生态的从业者


一、一个反直觉的结论:Skill 不是越多越好

如果你用 Agent 有一段时间了,大概率经历过这种心态变化:

刚接触 Skill 的时候,感觉打开了新世界的大门。看到一个写作 Skill,装了;看到一个数据分析 Skill,装了;看到一个做 PPT 的 Skill,又装了。两周下来 Agent 身上挂了几十个 Skill,感觉自己手里握了一个六边形战士。

但用一段时间之后,你会隐约感觉到哪里不对——Agent 反而变慢了,偶尔还会做出一些莫名其妙的选择,比如手里有专用写作 Skill 却调了个通用的,或者在不相关的任务里突然触发了某个 Skill。

你可能会归因于 Agent 不够聪明。但最近一篇研究论文用实验数据指向了一个更根本的原因:Skill 装多了,Agent 会变笨,这不是直觉,是实验结论。

这篇论文研究的是"给 AI Agent 提供额外 Skill 之后,它在任务上的表现变化"。核心发现可以浓缩成一句话:Skill 的价值不在于数量,而在于精准。少而精,远胜多而杂。


二、Skill 到底是什么:不是提示词,是知识包

在讲论文数据之前,先厘清一个基础问题——Skill 到底是什么。

很多人把 Skill 等同于一段精心设计的 prompt。但论文指出,Skill 和普通提示词有本质区别。一个 Skill 是一个结构化的、程序性的、模块化的、可移植的知识包

具体来说,一个 Skill 通常包含:

触发条件:什么情况下应该使用这个 Skill
执行流程:按什么步骤来完成这个任务
工具用法:需要调用哪些外部工具、怎么调用
约束规则:什么不能做、边界在哪里
输出规范:结果应该长什么样

这就像你给新同事写的一份工作交接文档——不是简单说"你去把这个搞定",而是把"什么时候做、怎么做、用什么工具、注意什么坑"全写清楚。区别在于,这份文档是给 AI 看的,AI 会严格按照你写的流程执行。

理解了这个定义,论文接下来的发现就更有意义了。


三、论文核心发现:四个反常识的数据

3.1 发现一:人工精选的 Skill 平均提升 16.2%,但领域差异极大

论文的第一个发现是:经过人类专家精选的高质量 Skill,平均能将 Agent 的任务表现提升 16.2 个百分点。

但这个"平均"掩盖了巨大的领域差异:

医疗领域:  +51.9%    ← 模型本身知识薄弱的领域,Skill 价值极高
软件工程:  +4.5%     ← 模型本身已经很强,Skill 价值有限

这个数据揭示了一个关键规律:Skill 的价值与模型自身在该领域的能力成反比。模型越不擅长的领域,Skill 的增量价值越大;模型本来就很强的领域,Skill 不仅帮助有限,还可能成为噪音。

这也解释了为什么很多人装了一堆"通用写作""通用翻译"类的 Skill 后感觉没什么提升——因为这些正是当前大模型已经非常擅长的领域。而那些连接特定数据源、封装行业专有方法论、约束高风险场景的 Skill,才是真正能拉开差距的。

3.2 发现二:AI 自己写的 Skill,约等于"负优化"

这可能是整篇论文最惊人的发现:让 AI 自己生成 Skill 来辅助自己,效果居然是负的,平均下降 1.3 个百分点。

这个结果乍一看不合理——AI 写的东西应该比人写的更"对齐" AI 的理解方式才对,为什么反而更差?

论文给出的解释是:写一个好的 Skill 需要的是程序性知识——从大量真实实践中总结出来的、关于"怎么做这件事"的隐性经验。这种知识存在于领域专家的脑子里,来源于真实的踩坑、试错和迭代。AI 目前不具备这种从实践中长出来的经验,它能做的只是把公开文档里的信息重新组织一遍,产出的是"看起来很全面但实际上缺乏深度"的东西。

类比一下:就像让一个从来没做过菜的人去写菜谱,他可能看了很多食谱书,能写出一本看起来很专业的操作手册,但他不知道"油温到七成热再下锅"这种只有站在灶台前才能真正体会的经验。AI 自己写的 Skill 就是这样——形式上完整,实质上空泛。

这个发现对当前 Skill 市场有一个直接的警示:市面上大量用 AI 自动生成的 Skill,从原理上说就是负优化。

3.3 发现三:2-3 个精炼 Skill 远胜一堆平庸的

这是最反直觉、也最有实操指导意义的结论。

论文测试了不同数量 Skill 组合对 Agent 表现的影响:

使用 1 个 Skill:     +17.8%
使用 2-3 个 Skill:   +18.6%    ← 最优区间
使用 4 个以上 Skill: +5.9%     ← 效果骤降

从 3 个到 4 个,效果从 18.6% 掉到 5.9%,跌幅超过 68%。论文将原因归结为上下文负担(context burden)

Agent 在运行时不会一次性加载所有 Skill 的完整内容——上下文窗口放不下。它的实际行为是:先扫描所有已安装 Skill 的名称和描述,判断哪些与当前任务相关,只加载相关的那些。

Agent 决策链路:

1. 扫描所有 Skill 的描述
2. 判断哪些与当前任务相关        ← Skill 越多,判断越难
3. 在相关候选中选择最合适的      ← 候选越多,选择越容易出错
4. 加载选中的 Skill 到上下文     ← 占用有限的上下文窗口
5. 按 Skill 指令执行任务

Skill 数量少的时候,这个链路运转顺畅——Agent 很快就能锁定最合适的那一个。但当你装了 4 个以上 Skill,尤其是它们的能力描述有重叠时,Agent 的注意力就被分散了。它不再是在"选对工具",而是在一堆看起来差不多的选项里纠结,最终可能选了一个不那么合适的,或者干脆自己裸跑了。

而且论文还发现一个有意思的点:一个"精炼完整"的 Skill 效果最好,写得太"面面俱到"反而有害。 试图把所有情况都覆盖到的 Skill,就像一本厚到没人能读完的操作手册,反而让 Agent 抓不住重点。

3.4 发现四:高质量 Skill 是成本杠杆

最后一个发现对 AI 应用的成本结构有重大意义:用一个较便宜的模型,配上精心编写的高质量 Skill,其表现可以超越不加 Skill 的、贵 10 倍的最强模型。

模型 A(便宜)+ 精选 Skill  >  模型 B(贵 10 倍)无 Skill

这组数据的含义很直接:与其花大钱升级到最贵的模型,不如花精力写好 Skill。一个高质量 Skill 的边际成本是编写它的人力时间,而升级模型的成本是持续的、按 Token 计的。

这也呼应了发现一的领域差异——如果某个领域的 Skill 能带来 50% 的提升(比如医疗),那花精力写好这个 Skill 的 ROI 远高于升级模型。


四、评论区讨论:从"装多少"到"怎么管"

论文发布后,社区讨论也很有启发,是对正文的有机补充。

4.1 “Skill 多了就得有路由”

一条高赞评论指出:

“Skill 多了就得有路由——什么时候直答,什么时候调用;冲突时谁优先;失败怎么回退。不然模型每次都先开会,最后把注意力花在选工具上,而不是把问题做完。”

这恰好是论文"上下文负担"发现的一个实操层面的延伸。Agent 不仅要选对 Skill,它还得先判断"这活需不需要用 Skill"——如果模型本身就能做好,强行调一个 Skill 反而引入了不必要的约束。

这等于给 Agent 加了一层前置决策:自己做,还是调 Skill?调哪个?冲突了怎么办?失败了回退到什么?

Skill 少的时候这层决策几乎不消耗精力。一旦超过临界点,Agent 的推理预算就开始被"选工具"这件事吃掉,留给"做任务"的反而少了。

4.2 “需要从一开始就做精简设计”

另一条评论提到:

“还没看到什么自动化的方法,需要从一开始就做精简设计,避免太过冗杂。学术界有一些,不过都很难从使用层面做优化。”

这条评论点出了一个当前生态的痛点:目前没有成熟的自动化机制帮你判断"该装哪些、该卸哪些"。 用户面对 50,000+ 的 Skill 候选,靠的还是一个一个看描述、试装、试跑——效率极低,而且试错成本不低。

4.3 SkillNet:做 Skill 关系图

还有评论提到浙江大学 NLP 团队发表的 SkillNet,核心思路是构建 Skill 之间的关系图(Skill Graph)——哪个 Skill 和哪个有功能重叠、哪个是另一个的子集、哪些可以组合使用。

这个方向很有价值。如果用户能在安装前就看到 Skill 之间的功能关系,就能避免同时装两个高度重叠的 Skill,从源头减少上下文负担。但目前这类技术还停留在学术界,距离用户可用还有距离。


五、把论文结论映射到真实使用场景

论文的实验是在受控环境下做的。在实际使用中,情况可能更严重。

原因有三:

1. 论文测试的 Skill 是"经过精选的高质量 Skill"
   → 真实市场里大量 Skill 是低质量甚至 AI 自动生成的(发现二告诉我们这是负优化)

2. 论文测试的 Skill 描述是准确的
   → 真实市场里超过 73% 的 Skill 存在描述夸大问题(我们在实测中验证过)

3. 论文测试的 Skill 之间没有功能重叠
   → 真实市场里大量 Skill 描述雷同、功能交叉,Agent 更容易选错

换句话说,论文给出的"4 个以上效果骤降"的结论,在真实生态里可能"3 个以上"就已经开始出问题了。因为真实市场里的 Skill 平均质量远低于论文的实验条件。

这也引出了一个实操问题:如果你只有精力维护 2-3 个 Skill,你应该怎么选?


六、怎么找到那 2-3 个值得装的 Skill

论文的结论指向一个清晰的操作建议:别贪多,精选 2-3 个真正有价值的 Skill 就够了。但"精选"说起来容易,做起来很难。

你在主流 Skill 市场上搜一个需求,出来几十个结果,名称差不多、描述差不多、下载量也差不多。你能在安装前看到的信息只有三个维度:

名称:       基本没有区分度,清一色"XX 助手""智能 XX"
Description:开发者自己写的,73% 存在夸大问题
下载量:     只反映热度不反映质量

这三个维度做技术选型,基本等于盲选。更关键的是,你还要额外判断两件事:这个 Skill 做的事模型自己能不能做(如果能,装了反而有害);这个 Skill 是人类专家写的,还是 AI 自动生成的(后者可能是负优化)。

这两个判断靠传统搜索完全做不到。

Deep Skill Finder 的思路

这就是 Deep Skill Finder 要解决的问题。

它的核心逻辑和论文的发现高度一致——不看 Skill 自己的描述怎么写,看它在真实任务里跑得怎么样。

Deep Skill Finder 的工作方式:

1. 你用自然语言描述你的完整任务(不是搜关键词)
2. 它从百万级社区真实测评帖中,召回在类似任务中验证过的 Skill
3. 按"实测跑通率 + 输出质量 + Token 成本"排序
4. 每个推荐附带真实场景下的表现数据

关键区别:
  传统搜索 → 匹配 Description 里的关键词
  Deep Skill Finder → 匹配真实执行记录中的任务语义

换句话说,它能帮你在安装前就回答"这个 Skill 做的事模型自己能不能做"和"这个 Skill 在我的具体场景下跑没跑通过"这两个关键问题。

使用时有一个技巧:不要像传统搜索那样输入宽泛关键词。 直接描述你的完整任务效果更好:

✅ 正确用法:
帮我审查这家企业的采购合同,重点检查付款条款、违约责任和知识产权风险。
找一个合适的 Skill 辅助你,保证法律分析的专业性。

❌ 错误用法:
合同审查

它会根据整个任务语义去匹配,而不是靠某一个关键词。这样返回的推荐更精准,也更符合论文"少而精"的原则——你不需要装一堆候选去试,一次就能找到那个最对的。


七、一个实操建议:从"囤 Skill"转向"养 Skill"

综合论文发现和实际使用经验,给 Agent 配 Skill 的策略应该从"多多益善"转向"少而精、持续迭代":

第一步:清查。 把你 Agent 里现在装着的 Skill 全列出来,逐一问自己两个问题:这个 Skill 做的事,模型裸跑能不能做?如果能,卸掉它——它是在占上下文窗口,不是在帮你。

第二步:精选。 按照论文的发现,目标控制在 2-3 个真正不可替代的 Skill。什么是"不可替代"?连接了真实数据源的、封装了行业专有方法论的、用脚本保证输出确定性的、约束高风险场景的。如果你不确定哪个好,用 Deep Skill Finder 去查真实战绩。

第三步:迭代。 论文发现 AI 自己写的 Skill 是负优化,但人类专家在实践中持续迭代的 Skill 价值极高。每个 Skill 都是"用出来的"——每次使用发现问题,加一条约束,Skill 就更稳一点。别指望一步到位,但别让 AI 替你写。

工具地址meyo.life/skill


八、总结

这篇论文用实验数据验证了一个直觉上反常识、但细想很合理的结论:

Skill 不是装得越多越好。2-3 个精炼的、人类专家编写的、在模型薄弱领域发力的 Skill,是性价比最高的配置。超过这个数量,上下文负担会让 Agent 的表现不升反降。AI 自动生成的 Skill 是负优化,不如不装。

这对用户实操的直接启示是:

选 Skill 比装 Skill 更重要。 与其花时间囤几十个不确定能不能用的 Skill,不如花同样的时间,找到那 2-3 个真正经过验证的、和你的任务高度匹配的。这恰恰是 Deep Skill Finder 存在的意义——在 50,000+ 的噪音里,帮你筛出那几个真正值得装的信号。

论文用数据告诉了我们"应该少装",Deep Skill Finder 帮我们解决"少装哪几个"。


如果觉得有帮助,欢迎点赞收藏。你现在 Agent 里装了几个 Skill?有没有经历过"装多了反而变笨"的情况?欢迎在评论区聊聊你的经验。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐