大模型Agent工程化:从“模型至上“到“Harness为王“

这是一篇,可能有点长的文章。
但我觉得,你值得看完。
因为接下来的话,可能会改变你对AI这件事的理解方式。
最近刷X的时候,看到一个数据,挺震撼的。
2026年春天,一个叫APEX-Agents的测试基准出来了——专门测AI Agent到底能不能真正"干活",而不是只会"聊天"。结果呢?GPT-5.2、Gemini 3 Flash,这些全地球上最顶级的模型,一次通过率只有23%-24%。
翻译成人话就是:一百件事,只能干对二十三件。
你说,这不对吧?GPT-5.2欸,不是最强的模型吗?
对。模型的能力进步是线性的,但从"回答问题"到"完成工作"的鸿沟,是非线性的。
什么意思呢?
就好比,你考试能考100分,但不代表你能上班。考试是闭卷答题,上班是开卷解决问题——还要跟人协作,还要处理意外,还要在不确定中做判断。
模型考100分和模型能上班,中间差了一个东西。
这个东西,叫Harness。
一. 你以为比的是模型,其实比的是"壳"
Harness Engineering,中文叫线束工程,2026年初被OpenAI的工程团队正式提出来。
说人话就是:给AI搭一个工作环境,让它能靠谱地把活干完。
OpenAI内部据说用了一百多万行代码来搞这套东西。
一百多万行。
你想想,GPT-5.2的参数量是多少万亿来着?但围绕它的"壳",也用了一百多万行代码。
这说明什么?说明行业里最聪明的一帮人已经意识到了一件事:Agent的工程化难度,可能比模型本身更值得认真对待。
Anthropic在2026年3月发了一篇工程博客,是理解这个趋势的关键文献。
他们的核心发现是:当AI开始连续几个小时做设计、写代码、搭应用的时候,光靠模型本身,已经撑不住了。
你需要一套专门的运行机制——什么时候拆任务、什么时候交接上下文、怎么验证生成结果、上下文撑不住时怎么压缩或重置。
这些东西,全都属于Harness的设计范畴。
他们的做法很有意思,借鉴了GAN(生成对抗网络)的思路——搞了三个角色:Planner(规划者)、Generator(生成者)、Evaluator(评估者),互相配合又互相挑刺。
但他们说,最难的不是多加一个Agent。
最难的,是先把"评价标准"做出来。
“这个设计好不好看”——这种主观判断,必须被拆解成具体的、能打分的标准。否则评估环节就无从谈起。
这就好比你打游戏,如果不知道怎么算赢,那怎么打都是瞎打。
后来Claude Code的源码泄露了——大约1900个文件、超过51.2万行TypeScript代码——也验证了这一点。
它的架构核心被描述为:一个本地运行时外壳,把LLM包裹在工具、记忆和编排逻辑之中,让模型能在现实世界里行动。
注意这句话的关键词:外壳。
模型是内核,Harness是外壳。没有外壳的内核,跑不起来。
更值得关注的是Claude Code的一个设计哲学,叫TAOR循环——运行时越笨,架构越稳定。
它只提供四种能力原语:Read、Write、Execute、Connect。就这四个。
然后Bash作为通用适配器,让模型通过shell组合使用任何人类开发者会用的工具。
“把智能下沉到模型,把确定性留给框架”。
这个思路,正在成为整个行业的共识。
二. 三件套:Harness是骨架,Skills是技能树,MCP是协议
如果说Harness解决的是"怎么让Agent持续做对事"——
那Skills解决的就是"Agent能做什么事",以及"这些能力怎么被组织"。
MCP解决的则是"Agent怎么跟外部世界对话"。
三个东西,各管一摊,但缺一不可。
先说Skills。
2025年底,Anthropic推出了Agent Skills标准。说人话就是——给AI做了一套标准化的"工作手册"。
以前呢,你想让AI干一件复杂的事,得塞一堆提示词,调来调去,像个玄学仪式。
现在呢,你把经验封装成一个Skill——任务指令、代码能力、资源模块,全打包好。别人遇到同样的问题,直接加载就能用,不用重新踩坑。
这东西有个很骚的设计,叫"按需加载"。
Agent启动的时候,只读一个极简的能力索引。只有当你的输入真正匹配到某个场景时,才加载完整定义。
为什么要这样?
因为传统的Agent有个致命悖论:工具越多,越笨。
就像你给一个人塞了一百把钥匙,他反而不知道该用哪把了。所以Skills的设计是——平时只让你看到钥匙清单,等你真的要开门了,再把对应那把递给你。
截至2026年2月,公开可用的Agent Skills已经超过85000个了。支持这个标准的平台27家,覆盖开发、设计、办公、电商、金融……
TechCrunch管它叫"AI领域的Dockerfile"。
我觉得这个类比非常精准——Dockerfile让应用变得可移植、可组合、可版本控制。Skills也一样,它让AI能力变成了可继承、可协作的工程资产。
再说MCP。
Model Context Protocol,Anthropic在2024年底推出的开放标准。
说人话就是:给AI和外接工具之间定了一套"通用语言"。
到2026年3月,MCP的SDK月下载量已经到了9700万次。ChatGPT、Cursor、Gemini、Microsoft Copilot……全在用。
2026年1月,Anthropic把MCP捐给了Linux基金会旗下的Agentic AI Foundation,跟OpenAI的AGENTS.md和Block的goose项目一起,成了这个新基金会的创始项目。
听起来很美好对吧?
但是。
2026年3月,AI搜索引擎龙头Perplexity公开宣布放弃MCP,回归CLI。
引发了"弃坑潮"。
他们的技术负责人说了一句话,我觉得特别到位:MCP在上下文窗口里占了太多Token——大约50个工具的定义就会吃掉约20000个Tokens。
导致模型"注意力全放在记工具名上",执行和推理能力严重受损。
Y Combinator的CEO Garry Tan甚至公开说"MCP很烂"。
你看,这就是标准化协议的宿命——没有标准,生态碎片化,各搞各的;有了标准,还不够,还得持续演进。
就像当年的浏览器大战一样。标准是有了,但标准本身就是个不断吵架的过程。
三. "龙虾"不是Agent框架,是操作系统
OpenClaw,也就是大家叫的"龙虾",GitHub星标突破33万+。
这个数字什么概念?Vue.js搞了好几年才到这个数。龙虾从爆发到这个数,几个月。
黄仁勋在GTC 2026大会上说了一句话,我印象特别深:
“OpenClaw不是Agent框架,是操作系统。它和大模型的关系,就像浏览器和互联网。”
浏览器之于互联网,龙虾之于AI。
这个类比,绝了。
你想想,互联网早就有了,但真正让普通人能用起来的,是浏览器。浏览器不生产内容,但它是你触达所有内容的入口。
龙虾也一样——它不生产模型,但它是模型触达现实世界的入口。
而且这个类比还揭示了更深层的变化:Agent框架是"应用层",Agent OS是"系统层"。
当软件不再由人写,而是由AI Agent生成和执行的时候,操作系统这一层,必须发生根本性变化。
阿里云在2026年3月推出了Agentic OS——一个专门面向AI Agent的操作系统。
核心理念就一句话:未来操作系统的主要用户,将从人类变成Agent。
听上去有点科幻,但你仔细想想,一点也不夸张。当Agent开始帮你写代码、管理日程、筛选简历、做数据分析的时候,它需要的不就是一个操作系统吗?
Agentic OS在系统管理和运维场景中,相比传统OS能省30%以上的Token开销。在CVE评估场景中,Token节省率能到60%。
学术界也没闲着。2026年4月,Qualixar OS出来了——第一个应用层的通用AI Agent编排操作系统。
支持10个以上的LLM提供商、8个以上的Agent框架、7种通信传输协议。
它解决的核心问题是:你用CrewAI建的Agent,可以跟AutoGen框架的Agent无缝协同,不用重写代码。
这就像什么呢?
就像以前你用Windows的软件和Mac的软件不能互通,现在突然出了一个系统,两边都能跑。
基础设施的标准化,正在从"应用层Harness"向"系统层Runtime"下沉。
这意味着Harness层面的工程化趋同,会越来越快。
四. 五大框架打完了,但赢家通吃的游戏才刚开始
截至2026年3月,Agent框架的格局已经从"一堆实验品"收敛为"五个严肃平台":
OpenAI Agents SDK、Google ADK、Microsoft Agent Framework、NVIDIA NemoClaw、LangChain生态。
注意到了吗?全是全球最大的科技公司。
小团队做的框架呢?要么被收购了,要么消声匿迹了。
而且所有主流框架都已经支持了MCP、A2A这些开放标准,在工具调用层实现了高度标准化。
Traefik Labs写了一篇文章,标题很直白:“The Agent Framework Wars Are Over. Everyone Won. That’s the Problem.”
框架战争结束了,每个人都赢了。但这也是问题所在。
为什么?
因为这些框架不是中性的工具,而是"模型消费、云计算和推理收入的分配机制"。
说人话就是——没有一家平台公司有动力让自己的框架跟竞争对手互换。
切换成本,就是商业模式本身。
这跟云的竞争格局一模一样:AWS、Azure、GCP,技术栈本质上高度相似,但迁移成本高到足以让企业"选一家、长期绑定"。
所以,即便Harness在技术设计上趋同了,商业层面的"生态锁定"才是新的战场。
同质化不等于开放化。
每个大厂都在用趋同的技术,构建封闭的生态。
这就像什么呢?就像手机充电口——Type-C标准是统一的,但你还是得买各家自己的充电头,因为协议不一样、功率不一样、认证不一样。
标准是标准,生态是生态。两码事。
五. Manus:一个关于"先发"的残酷故事
聊Agent,绕不开Manus。
2025年3月,Manus横空出世——全球第一个通用AI Agent产品。
内测邀请码一度被炒到10万块。
10万。一个邀请码。
我当时也想搞一个来着,没抢到。
然后呢?
一年后,Manus的独立访客和访问时长持续走低,用户留存率长期低位。
跟开源的"龙虾"形成了鲜明对比。
为什么会这样?
第一,没有自研基座模型。
Manus底层完全依赖Claude和GPT-4的API,被业内质疑为"套壳缝合怪"。
在Harness成为可复用标准的时代,"只有Harness没有模型"的中间层,护城河极浅。
你做的东西,模型厂商自己也能做,而且人家有模型、有用户、有生态,凭什么让你在中间赚差价?
第二,工程化能力被上游平台吞噬。
2026年4月,Anthropic推出了Claude Managed Agents——把开发者原本需要6到12个月才能搞定的基础设施(Agent Harness、托管环境、内置工具、沙箱、安全执行、长任务运行),全部平台化了。
直接腰斩了中间层Agent创业公司的生存空间。
这就是经典的"平台吃掉中间层"。
你自己费了九牛二虎之力搭的东西,平台一个更新就内置了。
你还怎么打?
第三,战略上的自我边缘化。
Manus从诞生起就刻意跟国内市场切割,裁撤了中国区业务将近三分之二。
但也没真正打入海外主流市场。
最终,两头落空。
Meta后来收购了Manus。
这个收购本身,就说明了一个残酷的产业逻辑:在Agent时代,“先发"不如"深耕”。
当Harness成为基础设施的标准配置时,单纯在应用层做"模型套壳"的价值,会被平台能力迅速蚕食。
真正能穿越周期的,要么是掌握模型底座的厂商,比如Anthropic、OpenAI;要么是在垂直场景中构建了深厚Skill积累和领域Know-how的团队。
没有中间地带。
六. 接下来会怎样?
基于上面这些分析,我对2026到2028年提几个判断。
不一定对,但我觉得值得想想。
短期(2026年):Harness工程化标准确立。
Harness Engineering会从"各家的独门秘籍"走向"可复用的工程范式"。
LangChain最近发布了一个叫Better-Harness的框架——把评估数据作为Agent自我改进的训练信号,在Claude Sonnet 4.6和GLM-5上都实现了近乎完全的泛化效果。
MCP的2026年路线图、Agent Skills的标准化推进、各大厂商的Agent OS实践,都会在今年内形成初步的行业共识。
中期(2027年):Skill生态成为核心竞争维度。
当Harness层面的工程化差异趋于收敛,竞争的焦点会上移至"谁拥有更丰富的可复用Skill生态"。
到2027年,一个类似Docker Hub或VS Code Marketplace的Skill交易市场很可能成型。
Skill的开发、分发和商业化,会成为新的产业环节。
长期(2028年及以后):OS层编排能力决定胜负。
当Harness和Skill都成为基础设施级的标配后,最终的差异会回归到——
你对模型脾性的熟悉程度,以及你的Skill编排智慧。
竞争会从"有没有Skill"转向"怎么高效组合、动态调度、实时纠偏"。
从"单Agent任务执行"转向"多Agent系统协同"。
从"对话式调用"转向"后台常驻、场景感知、主动建议"。
这意味着未来的"AI OS玩家"需要解决的不只是工程问题,更是认知交互问题。
当概率性智能成为系统的内生组成部分后,你怎么重构传统建立在确定性假设之上的系统语义和可信边界?
这是一个没人能给出现成答案的问题。
写在最后
最近经常想一个问题。
当AI基础设施像水和电一样普遍的时候,什么才是不可替代的?
给一个设计师和普通人完全相同的Photoshop——不,连插件包都一样——产出天差地别。
不是工具不同,是使用工具的人不同。
更准确地说,是**“使用习惯"和"编排智慧”**的差距。
未来AI领域的核心竞争,将不再是"我装了哪些Skill",而是——
我知道在什么时候,用什么方式,如何组合这些Skill。
以及,什么时候该果断打断模型的错误循环。
这让我想起打游戏的经历。同样的英雄、同样的装备、同样的技能树,高手跟菜鸟的区别,永远不是"你装了什么",而是"你在什么时机做了什么选择"。
Agent时代也一样。
模型会越来越强,Harness会越来越标准,Skill会越来越多。
但玩得溜的人,永远比别人更有优势。
不是因为工具,而是因为判断力。
时代不会问你准备好了没有。
它只会无情地翻到下一页。
以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~谢谢你看我的文章,我们,下次再见。
更多推荐



所有评论(0)