前段时间有个粉丝去面蚂蚁,岗位跟大模型应用相关。他提前准备了不少Agent相关的知识点,简历上也写了"熟悉主流Agent设计模式"。面试前面试官聊了几轮项目,气氛还不错,然后随口问了一句:“你了解哪些Agent设计模式?”

他一听这个来劲了,一口气报了十几个出来:ReAct、Plan-and-Execute、Reflection、Self-Refine、Tree of Thoughts、Graph of Thoughts、Tool Use、Memory、Router、Supervisor、Multi-Agent、Loop Engineering……报得还挺顺,心里当时还有那么一点小得意。

面试官等他说完,笑了笑,换了个角度问:“那你可以系统分析一下,这些模式各自聚焦的点是什么吗?”

他愣住了。支支吾吾了半天,只憋出几句"这个是用来推理的"、“这个是多个Agent一起干活的”,然后就说不下去了。面试官没追问,只是微微点了点头,但他自己知道,这一题答得不好。

回来之后他找我复盘,说自己把这些模式的名词全背下来了,但从来没想过它们之间的层级关系。我帮他梳理完之后,他才意识到——这些东西根本不是平级的,它们回答的是四个完全不同层次的问题。

今天就把这套四层框架说清楚,下次再被问到,不用再支支吾吾了。

✦ ✦ ✦

一、问题出在哪:它们根本不是同一个维度的东西

很多讲Agent设计模式的文章、图片,喜欢把十几种模式并排画在一张图里面。看起来好像很全的样子,但是也很容易让人误以为它们是"平级"的、可以互相替代选择的那种选项。

实际上完全不是这样的。这13种模式分别回答的是四个不同层次的问题:

  • ◆有的是在回答"Agent怎么思考"这个问题——这个属于推理算法层面的
  • ◆有的是在回答"Agent能干什么"这个问题——这个属于能力组件层面的
  • ◆有的是在回答"多个Agent怎么协作"这个问题——这个属于系统架构层面的
  • ◆有的是在回答"Agent怎么持续跑起来"这个问题——这个属于运行机制层面的

面试官问的那个"聚焦的点",问的其实就是这四层。如果当时能把这十几个名词往这四个抽屉里面一放的话,那场面试的分数应该会完全不一样吧。

✦ ✦ ✦

二、重新搭一遍框架:Agent的四个层级

Agent        ┌─────────────────────┐        │   推理(Reasoning)  │        └─────────────────────┘      ReAct / Plan-and-Execute      Reflection / Self-Refine      ToT / GoT                ↓        ┌─────────────────────┐        │   能力(Capability) │        └─────────────────────┘      Tool Use / Memory                ↓        ┌─────────────────────┐        │   调度(Orchestration)│        └─────────────────────┘      Router / Supervisor / Multi-Agent                ↓        ┌─────────────────────┐        │   自主执行(Loop)    │        └─────────────────────┘      Loop Engineering

下面呢就按这四层,把十几个名词逐个拆开来讲清楚吧。

✦ ✦ ✦

三、第一层:推理(Agent怎么思考)

这一层解决的是最核心的那个问题:Agent拿到一个任务之后,脑子里是怎么转的。

先说Single Agent吧。这个是最原始的形态,用户输入什么,LLM就直接输出答案。没有规划、没有工具、也没有循环。最早的ChatGPT就是这样的,适合做问答、总结、翻译这类一次性就能搞定的任务。

然后是ReAct。这个模式就是思考(Thought)然后行动(Action)然后观察(Observation)然后再思考,边做边看结果来调整策略。这是今天绝大多数Agent的推理基础,基本上大家都绕不开这个。

接下来是Plan-and-Execute。这个是把ReAct拆成了"规划"和"执行"两层。先让Planner生成一份完整的计划出来,然后再交给Executor一步一步去执行。这样就减少了反复调用大模型的开销。Claude Code这类编程Agent大量在使用这种模式。

再说Reflection。这个是执行完之后,自己回头检查一遍——看看代码有没有bug啊,逻辑有没有漏洞啊什么的。是一次"复盘",而不是重新去生成一遍。

还有Self-Refine。这个比Reflection更进一步,不是只查一次,而是"生成→批评→改进→再批评→再改进"这样循环去打磨。很多写作类Agent会用这个模式来持续优化输出的质量。

然后是Tree of Thoughts,简称ToT。这个就不再是一条推理路径走到底了,而是同时展开多个思路分支。每个分支继续往下扩展,最后用DFS、BFS或者Beam Search之类的策略在这些分支里面搜索最优解。

最后是Graph of Thoughts,简称GoT。这个是ToT的升级版,从"树"变成了"图"。节点之间可以合并、回流、交叉引用,适合知识推理、科研分析这类需要复杂关联的场景。

这一层的共同点是什么呢?它们都是在解决"怎么想问题"这个问题,谁也不管工具怎么调、多个Agent怎么配合这些事儿。

✦ ✦ ✦

四、第二层:能力(Agent能干什么)

这一层不涉及推理逻辑,只是让Agent从"光会想"变成"真的能做事"。

先说Tool Use。这个就是让Agent能够调用Python、Shell、搜索、SQL、浏览器、各类API这些工具。没有工具调用能力的话,再会推理的LLM也只能"纸上谈兵"嘛。今天大部分MCP场景本质上都是在解决这一层的问题。

然后是Memory。这个分为短期记忆和长期记忆两种。短期记忆就是对话上下文、临时草稿这些。长期记忆就是向量数据库、用户画像、历史项目经验这些。Memory本身不负责推理,只是给推理过程提供更完整的上下文信息而已。

这一层的共同点是什么呢?它们回答的是"Agent的能力边界在哪里"这个问题,跟"怎么思考"是两码事儿。

✦ ✦ ✦

五、第三层:调度(多个Agent怎么协作)

当一个Agent搞不定复杂任务的时候,就需要多个Agent来配合了。这一层解决的就是协作方式的问题。

先说Router Pattern。这个是先做意图分类,判断一下任务属于编程、金融还是旅行等哪个类别,然后再分发给对应的专用Agent去处理。

然后是Supervisor Pattern。这个是有一个"总管"Agent,负责给下属的搜索Agent、代码Agent、金融Agent分配任务、汇总结果、判断是不是结束了。OpenAI Swarm的设计思路跟这个比较接近。

还有Multi-Agent。这个是没有明确的领导者,多个Agent(比如说Research、Writer、Reviewer、Planner这些)平等协作、互相通信。AutoGen是这类架构的典型代表。

这一层的共同点是什么呢?它们解决的是"组织结构"这个问题,跟单个Agent内部怎么推理是没有关系的。

✦ ✦ ✦

六、第四层:运行机制(Agent怎么一直跑下去)

这一层只有一个模式,但它是最近讨论度最高的一个。

Loop Engineering这个模式呢,既不是推理算法,也不是系统架构。它是让Agent能够持续运行的一个机制。具体来说就是目标(Goal)然后思考(Think)然后行动(Act)然后观察(Observe)然后评估(Evaluate)然后判断是否继续,然后循环往复。用一句伪代码来概括的话就是这样的:

while not finish:    think()    act()    observe()    evaluate()

Claude Code、Codex、Cursor、Gemini CLI,这些今天主流的Agent产品,底层几乎都是这种持续循环的运行方式。

✦ ✦ ✦

七、它们不是互斥的选择题,而是可以叠加的组合

面试的时候犯的另一个错误呢,是下意识地把这些模式当成"选一个"的单选题在理解。实际上一个成熟的Agent系统,往往是把好几层的模式叠在一起用的。

比如说Claude Code吧:

Loop Engineering(持续运行)        │Plan-and-Execute(先规划后执行)        │ReAct(边做边看)        │Reflection(执行后自查)        │Tool Use + Memory(调用工具、记住上下文)

再比如说一个企业级客服Agent,可能同时会用到Loop、Router、Supervisor、Multi-Agent、Tool Use、Memory、ReAct这七种模式的组合。

所以准确的说法不是"这个系统用了哪种Agent模式",而是"这个系统用了哪几层、哪几种模式的组合"才对。

✦ ✦ ✦

八、如果按演进路线来看

除了按层级横切之外呢,还有一条纵向的演进逻辑。这个也是这两年Agent技术发展的大致脉络:

Single Agent      │ReAct      │Plan-and-Execute      │Reflection      │Tool Use + Memory      │Router / Supervisor / Multi-Agent      │Loop Engineering(持续自主运行)

用一句话来总结这条路径的话:ReAct、Plan-and-Execute、Reflection决定了Agent怎么思考;Tool Use、Memory决定了Agent能做什么;Router、Supervisor、Multi-Agent决定了多个能力怎么协同;Loop Engineering则把这一切组织成一个能持续运行、不断感知和完成目标的自主系统。

从2025–2026年的趋势来看呢,主流Agent产品早就不是单一的ReAct了。现在是以Loop Engineering + Plan-and-Execute + Batched ReAct + Reflection + Tool Use + Memory这个组合为核心的架构。这也是目前工程实践里面最常见、最有效的设计范式了。

✦ ✦ ✦

九、写在最后

回到开头那个粉丝的面试场景。如果当时他能直接说出这四层框架的话,估计效果会完全不一样吧。不是知道的模式更多了,而是同样的知识点,用结构化的方式讲出来,含金量是完全不同的。

背概念和理解体系,是两种能力。这次面试给他最大的一个提醒就是:技术学习到了一定阶段之后呢,比拼的已经不是"知道多少个名词"了,而是"能不能把这些名词放进一张清晰的地图里面"。

学AI大模型的正确顺序,千万不要搞错了

🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!

有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!

就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

在这里插入图片描述

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇

学习路线:

✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经

以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!

我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费

在这里插入图片描述

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐