在人工智能领域,提升AI Agent(智能体)的任务执行能力是一项核心课题。当前一个主流技术路径是为其添加技能包(Skills),即一系列自然语言指令或代码片段,指导Agent如何更好地完成特定任务。

这一技术路线看似合理,但Sentient Labs近期发布的研究《The Regression Tax: Decomposing Why Skills Help - and Hurt - LLM Agents》对此提出了系统性质疑。研究指出,技能包在提升部分任务表现的同时,往往也会导致模型在另一些原本能够独立完成的、未经修改的任务上性能退化。这种帮助与伤害并存的现象,被研究者定义为回归税(Regression Tax)。

5832次实验,59%的增益被抵消

当前,评估技能包有效性的主流指标是平均任务成功率。例如,若引入技能后100项任务中新增5项通过,则该技能通常被视为有效。

然而,该研究通过覆盖5832次配对对照实验(涉及两个办公自动化基准测试及三组模型-工具链组合)的数据分析表明,平均成功率是一个信息高度失真的汇总统计量。研究团队将任务结果细分为四类:

  1. 增益(Gain):无 Skill 失败,有 Skill 通过;

  2. 回归(Regression):无 Skill 通过,有 Skill 失败——即回归税的具象化表现;

  3. 残留失败(Residual Failure):两者都失败;

  4. 维持成功(Retained):两者都通过。

实验数据显示,在所有Skill加载条件下,共观察到553次增益,同时伴有324次回归。回归对增益的抵消比例高达59%。这意味着Skill带来的正面收益,超过半数被其引发的负面效应所侵蚀。

当前市面上表现最优的技能库,拉开差距的核心不是解锁更多新任务,而是搞砸的旧任务更少

举个直观对比:Claude Sonnet 4.6运行OfficeQA测试,三套技能库新增成功任务分别是10、12、11,但退化数量2、7、4。单纯看增益排名,OpenAI生成Skill最强;算净收益,Anthropic Skill反超第一,因为它极少破坏Agent原有能力。绝大多数团队上线技能库后,只汇报上涨的通过率,完全无视被牺牲的业务场景,这也是企业AI落地频繁出现时灵时不灵的根本原因。

三种回归机制

论文归纳了三种导致回归的核心机制:

技能描述渗透(Skill-description Osmosis)

这是最隐蔽的干扰路径。Skill的描述文本常驻在系统提示词中,即便Skill本身从未被调用,其描述内容仍持续参与模型的上下文推理,从而影响模型行为。

案例:某项任务要求计算“关税率的中心移动平均值”。无Skill条件下,模型给出正确答案37.708%。引入技能包后,尽管该Skill全程未被调用,仅因其描述中包含“修订后数据”(revised figure)等词汇,模型即偏离原答案,输出38.757%,被判为错误。Skill未执行任何操作,仅凭存在感便干扰了模型的判断。

输入锚定偏移(Grounding Displacement)

这是Skill被调用时最主要的退化原因,占所有退化案例72.8%。

该问题发生在输入阶段。Skill自带标准化操作流程,会强制覆盖模型原生的信息读取逻辑。模型不再根据题目匹配对应文档、表格、年份数据,而是机械套用Skill步骤,读错原始素材。

案例:某项任务要求计算两个年份之间的绝对差值。无Skill时,Agent准确读取数值549与407,输出正确结果142。加载Skill后,流程强制跳转错误年份表格,计算结果直接变成542。计算逻辑未变,但输入原料的偏差导致了最终结果的系统性错误。

输出校验失效(Verification Displacement)

该问题发生在输出阶段。Skill可能抑制或取代Agent原本会执行的自我验证与输出检查环节。

案例:某项任务要求计算绝对百分比变化。无Skill时,Agent输出+4.815(正确)。加载Skill后,Agent计算出-4.816,数值精度符合容差,但符号错误,由于Skill流程中未包含检查符号的验证步骤,Agent直接输出了错误结果。原本会执行的输出校验,在结构化流程中被无意间省略了。

Skill设计的误区

论文揭示了一个更深层的结构性失衡:现有 Skill体系过度聚焦于方法(Method)阶段,即任务执行过程本身,但对输入理解(Grounding)与输出校验(Verification)两个关键环节投入严重不足。

具体而言:

  • 在文档问答类任务(OfficeQA-Pro)中,持续失败的任务,其根源绝大多数集中于输入环节,模型读入了错误的数据源。
  • 在表格自动化任务(SpreadsheetBench)中,34%的任务中的公式逻辑本身是正确的。失败原因在于模型使用了评分器无法解析的现代Excel函数(如AGGREGATE),导致验证环节未能正确执行。这进一步印证了验证能力缺失是系统瓶颈所在。

落地实操指南

论文最终指向两条实践建议。

评估层面:报告 Skill 的效果必须从净通过率升级为增益 vs 回归的综合评估。论文建议评估 Skill 时分别测试三种条件:无Skill、仅保留Skill描述、完整Skill包,单独量化渗透效应带来的隐性损耗;

设计层面:Skill 的内容重心要从 Method 转向 Grounding + Verification。好的 Skill 不只是“怎么做”的说明书,还应该包含“从哪里开始的定位信息”(哪个表、哪一列、什么格式)和“怎么确认做对了”的检查机制(结果须满足什么条件、符号是不是该为正)。论文发现,许多被认为失败的任务只是缺了验证,而不是执行本身有问题。

结语

Agent Skill不是越多越好,也不是流程越详细越强。这篇论文用近6000组真实办公场景实验,推翻了行业沿用已久的评估逻辑:Skill的价值,不在于新增多少能力,而在于尽可能少破坏原有能力。所谓回归税,本质是上下文污染、流程绑架、校验缺失叠加出的结构性损耗。未来成熟的Agent Skill体系一定会从堆砌操作步骤转向加固输入读取、完善输出校验。对企业落地团队而言,比起追逐自动生成Skill的新工具,先建立一套能识别退化、拆分双向收益的评估体系,才是降低AI业务翻车概率的最优解。

学AI大模型的正确顺序,千万不要搞错了

🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!

有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!

就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

在这里插入图片描述

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇

学习路线:

✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经

以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!

我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费

在这里插入图片描述

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐