AI Agent 从 Demo 到工业落地:Skills、Trajectory、Policy 与 Omniverse 训练体系解析
马斯克刚刚投下了一枚重磅炸弹:SpaceX与英伟达正式官宣深度技术合作,双方专为太空环境打造的AI计算系统Vera Rubin NVL72,将于明年第四季度首发升空,并在2028年实现大规模组网部署。
但在这场“算力上天”的狂欢中,真正值得开发者死磕的,其实是另一项极具颠覆性的底层硬件——Vera。作为全球首款专为AI智能体(Agentic AI)量身定制的CPU,它的问世直接宣告了一个旧时代的终结:过去几年,大模型的训练与推理几乎是GPU的独角戏;但现在,AI的工作模式彻底变了。
当AI从一个只会“生成答案”的问答机器,进化为能够围绕目标持续推理、自主调用工具、执行代码并观察反馈的Agent时,CPU不再是边缘的调度员,而是决定Agent行动效率的核心瓶颈。这也直接引起了当下AI工程界最硬核、也最让人头疼的灵魂拷问:
大模型可以通过海量数据“喂”出知识和推理能力,但一个需要自主决策、跨系统调用甚至直接控制物理设备的AI Agent,到底该怎么训?尤其是当它走出实验室的Demo,真正走进复杂的真实工厂和业务流时,我们究竟还需要给它“训练”什么?
一、AI Agent训练真正难在哪里?不是“答对”,而是连续“做对”
大模型解决的问题主要是:面对一个输入,什么输出更合理。Agent解决的却是另一个问题:为了实现一个目标,下一步应该采取什么行动。比如,让AI分析“昨天为什么良率下降”,最终交付的是一个答案。但如果目标变成“找到昨天良率下降的原因,并在不影响今天交付的前提下解决问题”,任务性质就完全不同了。
Agent需要自己判断先查什么数据、调用哪个系统,发现设备异常后是否还要检查物料和工艺,调整参数会不会影响其他订单,执行之后又该观察什么指标。如果结果没有改善,是继续调整、换一种方案,还是转交给人处理。

真正需要保证正确的,已经不是某一次回答,而是整条任务轨迹:状态判断 → 决策 → 工具调用 → 行动 → 反馈 → 再决策。这也是Agent比Chatbot难得多的地方。
假设一个任务需要连续完成20个关键步骤,每一步成功率都是95%。在一个仅用于说明问题的独立概率假设下,20步全部成功的概率只有约36%。
|
单步成功率 |
5步任务 |
10步任务 |
20步任务 |
|
90% |
59% |
35% |
12% |
|
95% |
77% |
60% |
36% |
|
99% |
95% |
90% |
82% |
注:该表仅用于说明长任务中的误差累积,并非实际Agent性能测试数据。
这揭示了Agent训练一个很重要的问题:模型在单次Benchmark上达到很高准确率,并不代表Agent就能稳定完成几十步的真实任务。任务越长、工具越多、环境越复杂,一个小错误越可能在后续步骤不断放大。所以Agent训练真正难的,不只是让模型“再聪明一点”,而是让它在一个不断变化的任务过程中,持续做出正确行动。
二、为什么Demo里的Agent运行很好,一进入工厂就变难?
很多Agent Demo之所以看起来效果很好,是因为它面对的是一个人为定义好的环境:任务边界明确,工具数量有限,输入相对干净,成功与失败也很容易评价。
工厂恰恰相反。一个生产决策可能同时受到订单、设备、物料、工艺、质量、物流、人员、库存、能源和维护计划影响,而且这些变量一直在变化。
因此Agent进入工厂以后,真正面对的是三种变化:

- 首先,环境从封闭变成动态。 同样一个设备异常,发生在普通订单和紧急订单上,处理方式可能不同;发生在刚换型和连续生产八小时以后,判断也可能完全不同。Agent面对的不是一道静态题目,而是持续变化的状态空间。
- 其次,目标从单一变成多目标。 一个排产Agent不能只追求设备利用率,还必须同时考虑OTD、换线次数、质量、库存、物流和能耗。设备Agent为了降低故障率可能希望降速,生产Agent为了交付却希望提高产能。两个判断局部都可能正确,但整个工厂未必最优。
- 第三,错误开始产生真实成本。 Coding Agent写错代码可以删除重来;生产Agent调整错设备参数,可能产生批量不良;机器人动作判断错误,甚至可能产生设备或安全风险。
所以从Demo到工厂跨越的,并不是一个简单的“部署鸿沟”。Agent从一个边界清楚、允许失败的数字任务,进入了一个动态、多目标,而且错误具有真实成本的复杂系统。
三、一个生产级Agent,究竟需要训练什么?
理解了这一点,再看Agent训练,就不能再把它理解成“重新训练一个大模型”。生产级Agent真正要获得的,是四类能力:Knowledge、Skills、Trajectory和Policy。

- 第一层是Knowledge:让Agent理解这个工厂。
SOP、设备手册、工艺参数、维修记录、质量案例、MES和ERP数据,可以帮助Agent建立对生产环境的基本理解。但这解决的主要是“它知不知道”。 - 第二层是Skills:让Agent真正拥有做事的能力。
Skills不是抽象知识,而是可以被反复调用、组合和执行的任务能力。比如对一个设备Agent来说,“查询设备状态”“读取报警历史”“比对同机型参数”“执行RCA分析”“生成维修建议”“提交工单”都可以被拆成一个个Skill。Agent的每次运行都要从一组经过定义、验证和授权的Skills中选择、组合和调用,这样就可以把推理约束在一个可管理的行动空间里。 - 第三层是Trajectory,学习事情是如何被做成的。
例如设备发生异常以后,工程师为什么先查询某项数据;看到什么以后排除了某个原因;为什么接着调用另一个系统;什么时候停止继续分析并升级给专家;采取措施以后,又观察哪些指标确认问题已经解决。这些过程比最后的“故障答案”更加重要。因为Agent真正需要学习的是在什么状态下,应该调用什么Skill,按照什么顺序行动。 - 第四层是Policy。面对过去没有发生过的情况,Agent如何做选择。
这时候,仅仅模仿历史Trajectory已经不够,需要让Agent进行大量Rollout,在不同环境下尝试不同的Skills组合和行动路径,再根据结果获得反馈。例如训练排产Agent,不是告诉它“订单A应该放到产线1”,而是给它OTD、设备利用率、换线次数、WIP、物流负荷和能耗等目标,让它不断尝试不同策略,并根据整体运营结果评价哪一种策略更好。
所以一个生产级Agent真正的训练路径,并不是“训练一个模型”,而更接近:Knowledge → Skills → Trajectory → Rollout → Policy
|
训练对象 |
主要内容 |
解决的问题 |
|
Knowledge |
文档、数据、案例、规则 |
我知道什么 |
|
Skills |
工具、API、标准动作、业务能力 |
我能做什么 |
|
Trajectory |
状态、选择、行动、结果 |
什么时候做、按什么顺序做 |
|
Policy |
目标、约束、反馈、奖励 |
什么情况下应该选择哪种行动 |
这也意味着,Agent时代真正重要的数据资产不只是“业务发生了什么”,还包括“业务是怎么被完成的”“哪些Skills被调用”“不同选择最后带来了什么结果”。
四、工业 Agent 进入生产:知识、系统与多智能体如何协同?
生产级 Agent 真正需要的并不只是模型能力,而是 Knowledge、Skills、Trajectory 和 Policy。但这些能力最终是否有价值,还是要看 Agent 能不能真正接入制造系统、调用业务能力,并完成真实任务。
从工业富联科技服务目前的应用实践来看,工业 Agent 正在沿着一条比较清晰的路径落地:先连接知识,再连接系统,最后进入跨系统、多 Agent 协同。

最基础的一层,是设备知识与运维场景。传统设备运维中,SOP、设备手册、维修记录、异常案例以及专家经验往往分散在不同文档和人员手中。设备发生异常后,工程师需要先判断问题属于哪一类,再搜索资料、查询历史记录,必要时还要依赖资深工程师经验。
通过知识库与 LLM Q&A,可以将设备文档、组织数据以及经验类材料统一纳入知识体系,由 Agent 根据自然语言问题进行检索、理解和回答。这里解决的并不只是“搜索更快”,而是把原来分散在文档和个人经验中的 Knowledge,转化成 Agent 可以持续调用的能力。
进一步进入复杂制造场景以后,单一知识问答已经不够。以质量异常为例,一个隐藏的 BGA 焊接缺陷可能直到后段测试才暴露出来,但真正的问题源头可能出现在前段生产。传统方式下,工程师往往需要分别查询 SFC、AOI、X-Ray、PTH、设备日志等多个系统,再人工关联不同站点的数据完成 Root Cause Analysis。
在 MoMClaw 多 Agent 架构下,这类任务可以进一步拆分为不同 Agent 与 Skills。质量 Agent 负责识别异常,数据采集能力负责获取 MES/SFC 等系统信息,根因分析 Agent 结合前后站数据完成异常关联,设备或机器人相关 Skill 再根据需要查询状态或执行后续任务。
整个过程从过去依赖人工切换多个系统,逐步转化为:异常发现 → 数据采集 → 跨系统追溯 → 根因分析 → 改善建议 → 结果反馈 → 知识沉淀。这里真正发生变化的是,Agent 不再只是调用大模型回答问题,而是开始拥有明确的任务角色、可调用的 Skills 和真实系统接口,并由多个专业 Agent 围绕同一个制造任务进行协同。
工业富联科技服务目前的质量根因分析案例中,已经通过多 Agent 协同连接生产检测及设备相关数据,对复杂质量异常进行跨系统追溯和分析,根因分析时间降低约 35%;在设备知识应用中,也通过知识集中化和快速检索,减少人工查询以及对资深人员经验的依赖。
从这个角度看,工业 Agent 的落地路径并不是直接追求“完全自主”,而是先把制造现场中的知识、系统接口、业务动作和专家经验逐步封装成 Agent 可以调用的能力。当 Knowledge 能够被检索、Skills 能够被调用、任务过程能够被记录,多 Agent 才真正具备从“回答问题”走向“完成任务”的基础。
----
现在再回头看SpaceXAI和NVIDIA为什么要围绕Agent重新设计CPU、GPU和整个计算系统,意义也就不只是算力本身。
Agent时代真正被放大的,是工具调用、任务执行、环境交互、Simulation和Rollout。过去几年,我们一直在解决一个问题:怎样训练一个知道更多、推理更强的模型。
接下来真正困难的问题可能是:
怎样训练一个能够在复杂、动态、不能轻易犯错的真实世界里,持续做出正确行动的Agent。
更多推荐



所有评论(0)