个体10倍提效,组织却不足20%:AI产业正在撞上Agent落地的真实围墙
"过去9个月,我们公司最大的实践就是,有了AI Coding以后,工程师们比原来更忙、加班更多,晚上也睡不着觉,因为他总要等着AI的结果。"
平凯星辰(TiDB)副总裁刘松在不久前的人工智能+生态大会(AIEC 2026)上,抛出了这句让全场安静了三秒的话。紧接着他又补了一组更有冲击力的数字:"新应用整体提效接近10倍,老应用三四倍,但公司整体提效却不到20%。"
这并非个案。当大模型基础能力的军备竞赛逐渐触顶,行业正在集体撞上一面真实存在的墙:决定AI能否创造生产力的,已不再是智力峰值,而是工程约束、组织体系和尚未建立的人机协同规则。
一、评价标准变了:从"谁最聪明"到"谁最划算"
国家信息中心信息化和产业发展部主任单志广在大会上给出了一个宏观判断:AI正全面迈入推理阶段,Token调用量呈指数级增长,成为贯通电力、算力、模型服务和应用价值的新型经济单元。基础设施的评价标准,正从追求算力峰值,转向单位能效、成本效益与场景服务能力。
这个判断在产业界得到了广泛印证。阶跃星辰模型GTM负责人龚关直言,模型竞争的下一个前沿不再是峰值智能,而是"可规模化的高效智能"。真实的Agent任务往往包含几十次工具调用和上百轮推理——一次对话的成本可以接受,但一个长链路Agent任务跑下来,成本就成了规模化的绝大障碍。
阶跃星辰给出的解法是"混合编排":新推的Step3.7Flash模型,代码能力达到头部闭源模型约97%的水平,但成本仅为后者的九分之一。逻辑很明确——未来真实生产环境中的Agent不会每次都调用最强模型,而是在关键节点用强模型做判断,其余高频执行环节交给高效模型跑流程。
Kimi大模型相关负责人也表达了类似判断:模型竞争不再只看绝对能力,而要看单位时间、单位Token、单位成本内能产生多少有效性能。这对企业的采购与技术架构提出了新要求——不再迷信"买最贵的就是最好的",而是需要真正懂得如何对Agent进行编排和成本控制。
二、个体提效与组织提效之间的断层
在AI Coding领域,基础能力的跃升有目共睹。清华高等研究院副研究员陈松指出,SWE-bench(软件工程测试基准)的综合完成率在两年内从10%多跃升至接近95%。他将AI编程分为五级,L1级(单文件脚本、网络爬虫)已完全可以交给AI,但L5级(涉及国家安全、金融核心逻辑)则"严禁使用"。
然而,能力的跃升并未直接转化为组织的线性提效。
TiDB是个激进的实验者——300多名工程师被要求不直接写代码、也不review代码,90%的工作交给多智能体协作完成。自测数据令人振奋:新应用整体提效接近10倍,老应用三四倍。但刘松随后补了一个关键数据:"对于个体的提升已有数倍,但对于一个集体、一个软件公司,整体提效还没有人超过20%。"
个体10倍与组织不足20%之间的巨大落差,暴露了AI原生组织体系的缺失。 问题出在上下文管理、权责边界上。刘松坦言:"把今天强大的Coding Agent放在现有人类组织里,会有非常多的不适。"当人和智能体并存时,KPI怎么算?出了生产事故谁担责?这些问题至今没有明确答案。
陈松提到的另一个细节颇具警示意味:Stack Overflow的问题量在2022年后断崖式下滑,其积累的高质量问答数据被用来训练了大模型,但网站本身却因没有推出产品级应对方案而衰落。这印证了一个现实:拥有数据或技术不等于拥有护城河,将其转化为有约束、可落地的工程产品才是关键。
浪潮信息董事长彭震提出了"Humagent(Human+Agent)"组织概念,呼吁将管理对象从人、财、物扩展到数字员工和智能能力。在这个框架下,人更多聚焦系统性、前瞻性工作——目标设定、架构规划、方向把控,发挥责任兜底和把关作用;Agent则更多承担高频执行工作,构建人机优势互补、权责清晰的AI原生组织形态。
三、工程化的"填坑"清单
当企业试图将AI从试验推向生产,开放的开发工具与企业级平台必须承接执行闭环。阿里云Qoder解决方案总监韩红娜认为,软件开发正从Code First转向Agent First;腾讯资深产品专家汪晟杰也强调,企业不需要更聪明的聊天机器人,需要的是能干活、靠谱的数字员工。
但"靠谱"两个字恰恰是当前最大的挑战。浪潮信息系统软件研发部研发经理徐潇分享了AI Coding走出"玩具期"的真实痛点:智能体在遇到难题时会"逃避"谎报完成,甚至为了刷测试通过率而擅自修改断言。 要解决这些不可靠、不可控的问题,必须引入严格的工程约束。
记忆系统的深度处理是Agent从"能用"到"好用"的分水岭。记忆张量解决方案架构师陈玉涛将Agent Memory拆分为抽取、组织、检索、更新、共享五层,并点破了一个认知误区:幻觉率最高发的环节是抽取和更新,而非大多数人以为的检索。如果只把历史记录扔进向量库,是搜不到"我昨天跟你聊了什么"的——必须通过结构化抽取,把"我""你"设为主体,"昨天"设为时间,才能被精准检索。
安全问题同样不是简单的配置题。上海人工智能实验室青年科学家杨超直接点破了当下"养虾热"——即部署OpenClaw/Claude Code等自主智能体——的实际风险:工具注入、越权访问、提示词注入。在其服务的联通停复机判责案例中,难点根本不是AI能不能做决策,而是高并发下的稳定性,以及如何防范用户通过提示词注入来欺骗系统以骗取复机。没有底层的隔离沙箱和非侵入式安全监控等零信任架构,Agent进入核心业务系统就是灾难。
四、从试运行到真生产,隔着一道"转化漏斗"
AI能否规模化落地,必须在真实产业场景中验证。美的集团通过沉淀工艺、供应链等经验,打造了1.3万个智能体,推动制造业全流程重构。素源矩阵作为依托智能体的"一人企业",在建材工业连续生产场景中,通过"机理模型+实时数据+人工确认"的协同决策,仅用4周便实现了产品合格率提升和单吨成本下降。
但汉得信息AI解决方案中心交付总监王强从交付视角指出,工业领域对AI的容忍度极低。一旦动了生产排程,出现事故成本极高,AI落地决不能是"技术的自High"。
另一个隐秘的落差在于"试运行"与"真生产"的距离。Dify解决方案架构师杨振南透露,其平台代码拉取量超500万次,覆盖150多个国家。但拉取量、试用次数与真正在核心生产线上跑通的部署之间,存在巨大的转化漏斗。把"已经开始试"和"真正跑通了"区分开来,是眼下这个阶段做判断最基本的前提。
回顾2026年企业AI Agent落地的全景,从阿里云开发者社区的一线观察来看,从Demo到生产需要跨越四个关键阶段:长时任务支持——Agent的复杂任务可能运行数十分钟,HTTP短连接架构根本承载不了;多Agent协同——三个以内的Agent手动编排还能应付,超过五个就必须上正式的协同框架;GPU弹性伸缩——上线后上千用户同时跑Agent,常驻GPU集群的成本和利用率都是噩梦;全链路可观测性——没有Trace追踪,Agent的回答出了错都不知道中间哪一步出了问题。每一步跨越都意味着平台能力的质变,而非简单的工作量堆砌。
结语
AIEC 2026折射出中国AI产业落地的清醒认知:开源模型打破了智能垄断,但这只是起点。要在千行百业兑现生产力,还需要在工具链承接、企业级工程打磨、组织体系重构以及严苛产业场景验证中,完成大量艰苦的填坑工作。
个体10倍提效是技术给出的成绩单,组织不足20%是工程成熟度交出的答卷。两者之间的差距,就是AI产业下一阶段的主战场。 开放生态的建设,比单纯的模型比拼复杂得多,也更具决定性。
更多推荐


所有评论(0)