在这里插入图片描述

这是一篇,可能有点长的文章。

但我觉得,你值得看完。

因为接下来的话,可能会改变你对AI这件事的理解方式。


最近刷X的时候,看到一个数据,挺震撼的。

2026年春天,一个叫APEX-Agents的测试基准出来了——专门测AI Agent到底能不能真正"干活",而不是只会"聊天"。结果呢?GPT-5.2、Gemini 3 Flash,这些全地球上最顶级的模型,一次通过率只有23%-24%。

翻译成人话就是:一百件事,只能干对二十三件。

你说,这不对吧?GPT-5.2欸,不是最强的模型吗?

对。模型的能力进步是线性的,但从"回答问题"到"完成工作"的鸿沟,是非线性的。

什么意思呢?

就好比,你考试能考100分,但不代表你能上班。考试是闭卷答题,上班是开卷解决问题——还要跟人协作,还要处理意外,还要在不确定中做判断。

模型考100分和模型能上班,中间差了一个东西。

这个东西,叫Harness

一. 你以为比的是模型,其实比的是"壳"

Harness Engineering,中文叫线束工程,2026年初被OpenAI的工程团队正式提出来。

说人话就是:给AI搭一个工作环境,让它能靠谱地把活干完。

OpenAI内部据说用了一百多万行代码来搞这套东西。

一百多万行。

你想想,GPT-5.2的参数量是多少万亿来着?但围绕它的"壳",也用了一百多万行代码。

这说明什么?说明行业里最聪明的一帮人已经意识到了一件事:Agent的工程化难度,可能比模型本身更值得认真对待。

Anthropic在2026年3月发了一篇工程博客,是理解这个趋势的关键文献。

他们的核心发现是:当AI开始连续几个小时做设计、写代码、搭应用的时候,光靠模型本身,已经撑不住了。

你需要一套专门的运行机制——什么时候拆任务、什么时候交接上下文、怎么验证生成结果、上下文撑不住时怎么压缩或重置。

这些东西,全都属于Harness的设计范畴。

他们的做法很有意思,借鉴了GAN(生成对抗网络)的思路——搞了三个角色:Planner(规划者)、Generator(生成者)、Evaluator(评估者),互相配合又互相挑刺。

但他们说,最难的不是多加一个Agent。

最难的,是先把"评价标准"做出来。

“这个设计好不好看”——这种主观判断,必须被拆解成具体的、能打分的标准。否则评估环节就无从谈起。

这就好比你打游戏,如果不知道怎么算赢,那怎么打都是瞎打。

后来Claude Code的源码泄露了——大约1900个文件、超过51.2万行TypeScript代码——也验证了这一点。

它的架构核心被描述为:一个本地运行时外壳,把LLM包裹在工具、记忆和编排逻辑之中,让模型能在现实世界里行动。

注意这句话的关键词:外壳

模型是内核,Harness是外壳。没有外壳的内核,跑不起来。

更值得关注的是Claude Code的一个设计哲学,叫TAOR循环——运行时越笨,架构越稳定。

它只提供四种能力原语:Read、Write、Execute、Connect。就这四个。

然后Bash作为通用适配器,让模型通过shell组合使用任何人类开发者会用的工具。

“把智能下沉到模型,把确定性留给框架”。

这个思路,正在成为整个行业的共识。

二. 三件套:Harness是骨架,Skills是技能树,MCP是协议

如果说Harness解决的是"怎么让Agent持续做对事"——

那Skills解决的就是"Agent能做什么事",以及"这些能力怎么被组织"。

MCP解决的则是"Agent怎么跟外部世界对话"。

三个东西,各管一摊,但缺一不可。

先说Skills。

2025年底,Anthropic推出了Agent Skills标准。说人话就是——给AI做了一套标准化的"工作手册"。

以前呢,你想让AI干一件复杂的事,得塞一堆提示词,调来调去,像个玄学仪式。

现在呢,你把经验封装成一个Skill——任务指令、代码能力、资源模块,全打包好。别人遇到同样的问题,直接加载就能用,不用重新踩坑。

这东西有个很骚的设计,叫"按需加载"。

Agent启动的时候,只读一个极简的能力索引。只有当你的输入真正匹配到某个场景时,才加载完整定义。

为什么要这样?

因为传统的Agent有个致命悖论:工具越多,越笨。

就像你给一个人塞了一百把钥匙,他反而不知道该用哪把了。所以Skills的设计是——平时只让你看到钥匙清单,等你真的要开门了,再把对应那把递给你。

截至2026年2月,公开可用的Agent Skills已经超过85000个了。支持这个标准的平台27家,覆盖开发、设计、办公、电商、金融……

TechCrunch管它叫"AI领域的Dockerfile"。

我觉得这个类比非常精准——Dockerfile让应用变得可移植、可组合、可版本控制。Skills也一样,它让AI能力变成了可继承、可协作的工程资产。

再说MCP。

Model Context Protocol,Anthropic在2024年底推出的开放标准。

说人话就是:给AI和外接工具之间定了一套"通用语言"。

到2026年3月,MCP的SDK月下载量已经到了9700万次。ChatGPT、Cursor、Gemini、Microsoft Copilot……全在用。

2026年1月,Anthropic把MCP捐给了Linux基金会旗下的Agentic AI Foundation,跟OpenAI的AGENTS.md和Block的goose项目一起,成了这个新基金会的创始项目。

听起来很美好对吧?

但是。

2026年3月,AI搜索引擎龙头Perplexity公开宣布放弃MCP,回归CLI。

引发了"弃坑潮"。

他们的技术负责人说了一句话,我觉得特别到位:MCP在上下文窗口里占了太多Token——大约50个工具的定义就会吃掉约20000个Tokens。

导致模型"注意力全放在记工具名上",执行和推理能力严重受损。

Y Combinator的CEO Garry Tan甚至公开说"MCP很烂"。

你看,这就是标准化协议的宿命——没有标准,生态碎片化,各搞各的;有了标准,还不够,还得持续演进。

就像当年的浏览器大战一样。标准是有了,但标准本身就是个不断吵架的过程。

三. "龙虾"不是Agent框架,是操作系统

OpenClaw,也就是大家叫的"龙虾",GitHub星标突破33万+。

这个数字什么概念?Vue.js搞了好几年才到这个数。龙虾从爆发到这个数,几个月。

黄仁勋在GTC 2026大会上说了一句话,我印象特别深:

“OpenClaw不是Agent框架,是操作系统。它和大模型的关系,就像浏览器和互联网。”

浏览器之于互联网,龙虾之于AI。

这个类比,绝了。

你想想,互联网早就有了,但真正让普通人能用起来的,是浏览器。浏览器不生产内容,但它是你触达所有内容的入口。

龙虾也一样——它不生产模型,但它是模型触达现实世界的入口。

而且这个类比还揭示了更深层的变化:Agent框架是"应用层",Agent OS是"系统层"。

当软件不再由人写,而是由AI Agent生成和执行的时候,操作系统这一层,必须发生根本性变化。

阿里云在2026年3月推出了Agentic OS——一个专门面向AI Agent的操作系统。

核心理念就一句话:未来操作系统的主要用户,将从人类变成Agent。

听上去有点科幻,但你仔细想想,一点也不夸张。当Agent开始帮你写代码、管理日程、筛选简历、做数据分析的时候,它需要的不就是一个操作系统吗?

Agentic OS在系统管理和运维场景中,相比传统OS能省30%以上的Token开销。在CVE评估场景中,Token节省率能到60%。

学术界也没闲着。2026年4月,Qualixar OS出来了——第一个应用层的通用AI Agent编排操作系统。

支持10个以上的LLM提供商、8个以上的Agent框架、7种通信传输协议。

它解决的核心问题是:你用CrewAI建的Agent,可以跟AutoGen框架的Agent无缝协同,不用重写代码。

这就像什么呢?

就像以前你用Windows的软件和Mac的软件不能互通,现在突然出了一个系统,两边都能跑。

基础设施的标准化,正在从"应用层Harness"向"系统层Runtime"下沉。

这意味着Harness层面的工程化趋同,会越来越快。

四. 五大框架打完了,但赢家通吃的游戏才刚开始

截至2026年3月,Agent框架的格局已经从"一堆实验品"收敛为"五个严肃平台":

OpenAI Agents SDK、Google ADK、Microsoft Agent Framework、NVIDIA NemoClaw、LangChain生态。

注意到了吗?全是全球最大的科技公司。

小团队做的框架呢?要么被收购了,要么消声匿迹了。

而且所有主流框架都已经支持了MCP、A2A这些开放标准,在工具调用层实现了高度标准化。

Traefik Labs写了一篇文章,标题很直白:“The Agent Framework Wars Are Over. Everyone Won. That’s the Problem.”

框架战争结束了,每个人都赢了。但这也是问题所在。

为什么?

因为这些框架不是中性的工具,而是"模型消费、云计算和推理收入的分配机制"。

说人话就是——没有一家平台公司有动力让自己的框架跟竞争对手互换。

切换成本,就是商业模式本身。

这跟云的竞争格局一模一样:AWS、Azure、GCP,技术栈本质上高度相似,但迁移成本高到足以让企业"选一家、长期绑定"。

所以,即便Harness在技术设计上趋同了,商业层面的"生态锁定"才是新的战场。

同质化不等于开放化。

每个大厂都在用趋同的技术,构建封闭的生态。

这就像什么呢?就像手机充电口——Type-C标准是统一的,但你还是得买各家自己的充电头,因为协议不一样、功率不一样、认证不一样。

标准是标准,生态是生态。两码事。

五. Manus:一个关于"先发"的残酷故事

聊Agent,绕不开Manus。

2025年3月,Manus横空出世——全球第一个通用AI Agent产品。

内测邀请码一度被炒到10万块。

10万。一个邀请码。

我当时也想搞一个来着,没抢到。

然后呢?

一年后,Manus的独立访客和访问时长持续走低,用户留存率长期低位。

跟开源的"龙虾"形成了鲜明对比。

为什么会这样?

第一,没有自研基座模型。

Manus底层完全依赖Claude和GPT-4的API,被业内质疑为"套壳缝合怪"。

在Harness成为可复用标准的时代,"只有Harness没有模型"的中间层,护城河极浅。

你做的东西,模型厂商自己也能做,而且人家有模型、有用户、有生态,凭什么让你在中间赚差价?

第二,工程化能力被上游平台吞噬。

2026年4月,Anthropic推出了Claude Managed Agents——把开发者原本需要6到12个月才能搞定的基础设施(Agent Harness、托管环境、内置工具、沙箱、安全执行、长任务运行),全部平台化了。

直接腰斩了中间层Agent创业公司的生存空间。

这就是经典的"平台吃掉中间层"。

你自己费了九牛二虎之力搭的东西,平台一个更新就内置了。

你还怎么打?

第三,战略上的自我边缘化。

Manus从诞生起就刻意跟国内市场切割,裁撤了中国区业务将近三分之二。

但也没真正打入海外主流市场。

最终,两头落空。

Meta后来收购了Manus。

这个收购本身,就说明了一个残酷的产业逻辑:在Agent时代,“先发"不如"深耕”。

当Harness成为基础设施的标准配置时,单纯在应用层做"模型套壳"的价值,会被平台能力迅速蚕食。

真正能穿越周期的,要么是掌握模型底座的厂商,比如Anthropic、OpenAI;要么是在垂直场景中构建了深厚Skill积累和领域Know-how的团队。

没有中间地带。

六. 接下来会怎样?

基于上面这些分析,我对2026到2028年提几个判断。

不一定对,但我觉得值得想想。

短期(2026年):Harness工程化标准确立。

Harness Engineering会从"各家的独门秘籍"走向"可复用的工程范式"。

LangChain最近发布了一个叫Better-Harness的框架——把评估数据作为Agent自我改进的训练信号,在Claude Sonnet 4.6和GLM-5上都实现了近乎完全的泛化效果。

MCP的2026年路线图、Agent Skills的标准化推进、各大厂商的Agent OS实践,都会在今年内形成初步的行业共识。

中期(2027年):Skill生态成为核心竞争维度。

当Harness层面的工程化差异趋于收敛,竞争的焦点会上移至"谁拥有更丰富的可复用Skill生态"。

到2027年,一个类似Docker Hub或VS Code Marketplace的Skill交易市场很可能成型。

Skill的开发、分发和商业化,会成为新的产业环节。

长期(2028年及以后):OS层编排能力决定胜负。

当Harness和Skill都成为基础设施级的标配后,最终的差异会回归到——

你对模型脾性的熟悉程度,以及你的Skill编排智慧。

竞争会从"有没有Skill"转向"怎么高效组合、动态调度、实时纠偏"。

从"单Agent任务执行"转向"多Agent系统协同"。

从"对话式调用"转向"后台常驻、场景感知、主动建议"。

这意味着未来的"AI OS玩家"需要解决的不只是工程问题,更是认知交互问题

当概率性智能成为系统的内生组成部分后,你怎么重构传统建立在确定性假设之上的系统语义和可信边界?

这是一个没人能给出现成答案的问题。

写在最后

最近经常想一个问题。

当AI基础设施像水和电一样普遍的时候,什么才是不可替代的?

给一个设计师和普通人完全相同的Photoshop——不,连插件包都一样——产出天差地别。

不是工具不同,是使用工具的人不同。

更准确地说,是**“使用习惯"和"编排智慧”**的差距。

未来AI领域的核心竞争,将不再是"我装了哪些Skill",而是——

我知道在什么时候,用什么方式,如何组合这些Skill。

以及,什么时候该果断打断模型的错误循环。

这让我想起打游戏的经历。同样的英雄、同样的装备、同样的技能树,高手跟菜鸟的区别,永远不是"你装了什么",而是"你在什么时机做了什么选择"。

Agent时代也一样。

模型会越来越强,Harness会越来越标准,Skill会越来越多。

但玩得溜的人,永远比别人更有优势。

不是因为工具,而是因为判断力。

时代不会问你准备好了没有。

它只会无情地翻到下一页。


以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~谢谢你看我的文章,我们,下次再见。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐