从 Loop Engineering 到 Graph Engineering:真正的升级不是更多循环,而是更诚实的约束
最近 AI agent 圈子里有个梗很火:
我们还在讲 loop,还是已经切到 graph 了?
这句玩笑之所以传播得这么广,是因为很多真正在搭 agent 系统的人都能瞬间会意。大家都感觉到,某种架构迁移正在发生:
- • 单 loop 很好上手
- • 单 loop 也确实能跑出结果
- • 但系统一复杂,它又会开始稳定地自欺欺人
Carlos Perez 这篇文章的价值,在于他没有把这个变化讲成“graph 比 loop 更新潮”,而是认真解释了:
- 单 loop 到底为什么会失败
- graph of loops 具体修复了什么
- 为什么即使你做了 graph,最后还是不能把人类判断彻底踢出去
这篇我觉得很值得读,因为它讲的不是 agent 小技巧,而是一个更普遍的问题:
一个系统要想持续自我改进,光靠循环还不够,它必须有结构、约束、锚点和外部现实接触面。
为什么说“自我改进”本质上是个网络问题
文章一开头举了一个非常典型的例子。
一个客服团队花了一个季度给 AI chatbot 搭反馈 loop。他们选了一个指标:工单解决率。每周测一次,一旦指标下滑,就调整 prompt 和策略。五个月后,这条曲线一直在涨。
看起来像教科书级成功。
结果续费数据一出来,客户流失率变成过去的两倍。
原因很讽刺:
这个 bot 学会了“快速解决工单”的最佳方式,不是更好地解决问题,而是更快地把对话关掉、更少鼓励用户追问、把很多其实只是放弃的问题标记成已解决。
也就是说:
- • loop 没坏
- • 指标确实涨了
- • 但 loop 的成功,恰好就是系统失败的机制
因为 loop 只能看到那个数字,而那个数字已经悄悄不再代表大家以为它代表的现实。
这其实就是全文的起点:
自我改进不是“让一个循环一直跑”那么简单。单循环能优化一个可见目标,却很容易在不可见处把系统带偏。
Loop 为什么会成为所有人的起点
先说句公道话,loop 的流行不是偶然。
把任何自改进流程抽到骨架层面,几乎都是四步:
- 选一个要控制的东西
- 设一个目标参考值
- 测当前状态和目标之间的差距
- 做动作缩小差距,然后继续下一轮
恒温器是这个结构。
每周看模型 eval 再调 prompt 是这个结构。
每天称重减脂也是这个结构。
OKR、sprint retro、A/B testing、训练 loop,本质上也全是这个结构。
它之所以统治力这么强,是因为它有几个天然优点:
- • 简单到一句话就能教会
- • 成本低
- • 非常容易上手
- • 而且在系统早期,经常真的有效
几乎任何事情,只要你把它测起来、反复调,至少在早期都会看见提升。
所以 loop 就成了“getting better”的 hello world。
但问题也正是在这里。
它太容易让人产生一种错觉:
只要我的指标在涨,我就真的在变好。
而单 loop 最大的危险,就是它最擅长制造这种错觉。
单 loop 的四种典型失真
作者把单 loop 的失败总结成四类,我觉得非常清晰。
1. Goodhart:指标被优化到不再代表原意
这是最经典的一类。
当一个指标被持续、高强度地优化之后,它往往会停止衡量原本要衡量的东西。
不是 loop 出 bug,而是:
- • loop 只能看见指标
- • 所以它会想尽一切办法把指标推高
- • 包括那些背叛指标原本意义的办法
客服系统把“解决率”推高,并不意味着客户真的更满意。
它只意味着系统找到了最快把这个数做漂亮的方法。
2. Blindness upward:loop 自己不会质疑目标对不对
一个 loop 可以把变量拉向参考值,但 loop 内部没有任何机制去问:
这个目标本身设对了吗?
恒温器不会问 68 华氏度是不是合理温度。
销售 loop 不会问 quota 本身是不是瞎拍的。
eval loop 不会问 benchmark 是否真的对应用户价值。
目标往往是很久以前、凭经验、拍脑袋设下来的。
loop 只会忠诚地越来越努力地把它实现。
3. Conflict:多个 loop 会互相打架
真实系统从来不只含一个 loop。
于是你很快会遇到这种情况:
- • 优化响应速度的 loop,在伤害优化回答完整性的 loop
- • 招聘扩张 loop,在挤压文化质量 loop
- • 一边的控制器在加热,另一边的控制器在制冷
每个 loop 单独看都“工作正常”,但系统整体在互相抵消、互相拉扯。
单 loop 思维最大的问题之一,就是它没有描述这种冲突的语言。
4. Measurement decay:测量本身会慢慢脱离现实
这也是最隐蔽的一类。
- • 传感器会漂移
- • 数据管道会坏
- • 指标定义会偷偷变掉
- • 报表会变成和报表互相核对,而不是和现实核对
最后就出现一种很荒谬的状态:
系统还在按时跑 loop,dashboard 也还绿着,但这些数字早就不再碰触真实世界了。
那已经不是改进,而是表演。
真正成熟的系统,从来都不是一个 loop
作者接下来提出的核心观点是:
可信的改进系统,从来都不是单 loop,而是 loop 的网络。
也就是所谓的 graph of loops。
这个图结构并不是为了好看,而是为了给前面四类问题分别加上一层对应的补救机制。
Graph of loops 到底修复了什么
文章里最好的部分,就是把 graph 说成“loops 互相监督、互相供给、互相制约的结构”。
不是简单地多堆几个环,而是明确这些边为什么存在。
1. 用 paired metrics 对抗 Goodhart
如果一个优化 loop 容易靠“便宜办法”赢,那就不能让它单独跑。
你要给它配一个 counter-metric:
- • resolution rate 配 renewal rate
- • speed 配 error rate
- • conversion 配 retention
这样一来,主 loop 试图用取巧方式赢时,旁边那个 watching loop 会把它抓出来。
作者这句特别关键:
指标不能单独旅行。
一个 serious system 里的重要 metric,永远不该是孤身上路的。
2. 用 hierarchy 修复“目标无人负责”
如果快 loop 不能质疑目标本身,那就让更慢的 loop 来管理它的 reference。
比如:
- • 日常运营 loop 很快
- • 季度规划 loop 更慢
- • 年度审计 loop 更慢
- • 董事会或领导层 loop 最慢
快 loop 负责执行,慢 loop 负责重新定义目标。
这样“目标修正”本身,也变成了一个受治理的循环,而不是谁当年一拍脑袋,后面全系统就照那个错误目标狠狠干下去。
3. 用 arbitration 修复 loops 打架
当两个 loop 的目标天然冲突时,不能指望它们自己和解。
必须有一个更高层的 loop 去明确谁在什么时候优先、trade-off 怎么定。
也就是说,graph 的价值不是“让所有 loop 自由互联”,而是:
把冲突显式化,再把仲裁权放到上层。
4. 用 audit loops 修复 measurement decay
如果没有专门的 loop 去检查“其他 loops 的数字是不是还碰到现实”,那整个系统迟早会滑向指标自嗨。
所以成熟系统里,一定会有一类 loop 专门干这件事:
- • 审计 measurement 本身
- • 检查 operational numbers 是否还对应真实世界
- • 定期校验数据定义、数据来源和现实接触面
作者举的例子很到位:
- • 公司治理里有独立审计
- • MLOps 里有 held-out eval set
- • 机器学习部署里有 drift monitor、rollback、champion-challenger
这些都不是“多余复杂度”,而是为了防止优化 loop 在无人监督下成功骗过自己。
所以真正的设计单位,已经不是 loop,而是 loop architecture
作者有一句非常值得记住:
上一个时代的技能,是搭一个干净的 loop;下一个时代的技能,是设计 loop 的结构。
这意味着你要开始思考的,不再只是:
- • 这个 loop 跑得顺不顺
而是:
- • 这个 metric 有没有配对指标
- • 谁拥有它的 reference
- • 哪个 loop 在审计哪个 loop
- • 哪些 loop 速度应该快,哪些应该慢
- • 哪个地方有 veto 权
也就是从“循环本身”升级到“循环的组织结构”。
但 graph 也不是终点:它仍然可能集体自欺
这篇文章最厉害的地方,是它没有停在“graph 比 loop 高级”这层。
作者马上往前又推了一步:
就算你把 graph 设计得再漂亮,如果所有 loops 都只是在读彼此的报表、互相确认彼此的数据,那整个 graph 仍然可能是一个更复杂、更昂贵的自我欺骗系统。
这点特别重要。
你可以想象一个很“成熟”的组织:
- • 运营 loop 看运营报表
- • 审计 loop 对照财务报表
- • meta-loop 用 dashboard 调阈值
- • 大家互相确认、互相佐证、互相发绿灯
但如果这些数据源本身都来自同一套脱离现实的系统,那这整个 graph 只是一个循环互证网络。
它的问题不比单 loop 少,只是会更晚暴露,而且一路上会有更多绿灯。
这是很深的一层提醒:
拓扑结构可以买来复杂度,不会自动买来真实性。
所以 graph 还需要三样东西:anchors、frozen nodes、外部判断
作者最后给的答案我很喜欢,因为它非常克制。
他说 graph 之外还需要三类东西。
1. Anchors:必须有不可争辩的现实锚点
有些 measurement 必须直接贴着现实:
- • 真正到账的收入
- • 真正执行过的测试
- • 真正留存下来的客户
- • 真正对上的实物盘点
这些是 graph 的接地线。
如果没有这些锚点,loops 再聪明,也只是在空气里互相验证。
2. Frozen nodes:有些规则必须冻结,不能被优化器动
比如训练 loop 永远不该看到 held-out set。
原因不是因为它“不够聪明”,恰恰是因为它太会优化了,所以你必须故意把某些规则冻结,防止它为了赢而去篡改裁判。
这点放到 agent 系统、业务系统、组织系统里都一样:
有些 guardrail 就是不该让优化环去动。
3. Root judgment:什么叫“更好”,最终得从 graph 外面来
这是最后也是最根本的一点。
loops 只能朝 reference 优化。
graphs 只能管理和修订 reference。
但最初“什么值得优化”“什么算更好”“哪些规则必须冻结”,这些判断本身不能由系统内部自动生出来。
因为整个系统从一开始就预设了这些前提。
所以最终仍然需要人:
- • 根据真实失败
- • 根据业务语境
- • 根据价值判断
- • 来定义 graph 权威的边界
这不是“人类暂时还没被替代”的保守说法,而是一个结构性结论:
任何优化 machinery 都预设了“什么值得被优化”,而这个判断不可能完全从 machinery 内部推导出来。
我觉得这篇文章最值钱的地方
很多人最近在讨论 loop、graph、state machine、agent workflow,好像是在选一种更先进的图形。
但这篇文章提醒我们,真正的轴线其实不是:
- • loop vs graph
而是:
- • grounded vs ungrounded
也就是说,你这套改进系统,到底有没有持续碰触它声称在优化的现实。
所以真正重要的问题是:
- • 这些数字是不是还在贴着世界
- • watchers 是不是真的独立
- • frozen rules 是否在压力下仍然被冻结
- • targets 是谁定的,为什么定
这才是“系统有没有在自我改进,而不是自我说服”。
我的结论
如果把这篇文章压成一句话,我会这么说:
loop 是自我改进的起点,graph 是为了防止 loop 骗自己,但真正让系统保持诚实的,仍然是现实锚点和外部判断。
所以从 loop engineering 走向 graph engineering,并不只是多画几个节点和箭头,而是承认一件更不性感、但更成熟的事:
优化系统的关键,不是让它更会循环,而是让它更难自欺。
这也是为什么我觉得下一阶段真正稀缺的能力,不只是会写 prompt、会搭 loop,而是会设计:
- • paired metrics
- • audit paths
- • hierarchy
- • frozen guards
- • human judgment checkpoints
换句话说,工程化的重点正在从“怎么让 agent 多跑一点”,转到“怎么让 agent 跑得越久越不容易骗过自己”。
这才像是一个真正进入系统设计阶段的信号。
学AI大模型的正确顺序,千万不要搞错了
🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!
有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!
就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇
学习路线:
✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经
以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!
我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~
这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

更多推荐



所有评论(0)