只会调 API、写 Prompt 可不够

Agent 的 3 种工作大脑

ReAct · Reflection· 规划执行

定义 · 使用场景 · 核心区别 · 组合拳

AI Agent 架构模式 · 科普

ReActReflectionPlan

5 PARTS + CONCLUSION

滑动

PART 01

开篇引入

三种性格

PART 02

小白也能懂

三种定义

PART 03

开发者实战

循环骨架

PART 04

进阶思考

区别与组合

PART ///

彩蛋思考

别踩的坑

01

PART

开篇:你手下其实有三个 AI

HOOK · 三种性格的打工人

基于ReAct、Reflection(反思)、Plan-And-Execute(规划执行)这三种架构的Agent,你可以简单理解为它们就是三种性格的打工人。

小 A 边查边干。你问他"这周有哪些值得关注的开源项目",他不会先列提纲,而是先搜索,看了结果再决定下一步搜什么,走一步看一步。这是ReAct

**小 B 做完还要自己改。**第一版写好了,他会自己通读一遍挑毛病,然后重写,再挑毛病再重写,直到满意。这是反思(Reflection)。

小 C 先交计划再动手。开工前先给你一份五步计划书,然后按部就班执行。这是规划执行(Plan-And-Execute)

这三种模式,就是 2026 年你在几乎任何主流 Agent 框架里都能见到的三种最基础的大脑。后面那些看着很唬人的架构(LangGraph 的状态机、AutoGen 的多智能体、各种 Agent SDK 的编排),拆开来看,基本都是这三样的排列组合。所以搞懂这三样,看任何框架文档都能秒懂它在干什么。

02

PART

小白也能懂:三种模式的定义

BASICS · 三种"大脑"的运作方式

ReAct:边想边做,做中学

ReAct 是**Reasoning + Acting(推理 + 行动)**的缩写。它不要求模型动手前想好一切,而是把"思考"和"行动"织进同一个循环:

Thought(我想) → Action(我做) → Observation(我看到了什么) → 再思考…

用做饭打比方:你进厨房不会先在脑子里完整模拟一遍"番茄炒蛋"再开火——你是先开火、倒油、下番茄,炒着炒着发现汁水多了,才决定大火收汁。ReAct 就是这个节奏:每一步都根据刚刚看到的新信息,决定下一步干什么。

它解决的核心问题是:很多问题在动手之前拿不到关键信息。“今天适合晨跑吗?”——不查天气和空气质量,模型永远答不准。ReAct 就是让它先想"我需要数据"→ 调工具 → 看到数据 → 再想"根据数据怎么给建议" → 输出。现在的 Claude、ChatGPT 这类产品,底层跑的就是这个循环。

Reflection:先做,再自己挑刺

反思模式让 Agent 当自己的质检员。它不在乎一次生成得对不对,它赌的是——第二轮肯定比第一轮好。

生成一版答案 → 自己评估有什么毛病 → 根据毛病重写 → 再评估 → 满意就交稿

类比:写完作文初稿,你自己通读一遍,圈出"这段逻辑不通"“这个例子太空”,改出二稿。反思就是把这个"自己审稿"的动作制度化、循环化。

为什么有用?因为大模型有个毛病——它生成答案时是"自信地编",一次生成的答案经常流畅但不准确。给它一个二次机会审视自己的输出,很多低级错误能自己揪出来。我实测过写代码任务:加上一轮反思,编译错误率能降一半以上(数据在后面)。

注意,反思有两副面孔:自我反思(同一个模型自己评价自己,省钱,但容易自我感觉良好)和换裁判(另一个模型当质检员,也就是 LLM-as-Judge,更客观,但贵一倍)。这俩差别很大,后面细说。

Plan-And-Execute:先交计划,再照单执行

规划执行把 Agent 拆成两个角色:**规划器(Planner)**负责把大任务拆成步骤清单,**执行器(Executor)**负责一步步照做。

Planner:任务 → [步骤1, 步骤2, 步骤3, …]
Executor:逐条执行(某步失败 → 带着失败原因回去重新规划)

类比:出差前先做行程单——机票哪天、酒店订哪、第一天去哪。执行的时候就不用反复"动脑子"了,照着单子走。它最大的收益是省 token:规划只做一次,执行每个步骤时上下文里只放当前这一步。代价是灵活性差——计划赶不上变化的时候,它容易抓瞎。

03

PART

开发者实战:三种模式的核心循环

HANDS-ON · 不贴完整代码,只给骨架

用同一个需求——“调研 2026 年值得关注的开源 Agent 框架”——看三种模式的核心循环长什么样。不贴完整代码,只给骨架。

ReAct:一个 while 循环搞定

…skeleton

核心循环:Thought → Action → Observation

while 没交卷:

思考(当前上下文) # Thought

调工具(如果需要) # Action

上下文 += 工具结果 # Observation

每轮都重发完整历史 → token 贵的根源

核心就一句话:**每轮把完整对话历史重发一遍,直到模型认为信息够了、直接回答。**这也是它 token 贵的根源。两个必踩的坑:循环次数不能无限次,max_steps 必须设——我见过 Agent 因为工具返回格式不对,连调 50 次,token 费比任务本身还贵;工具返回格式必须和 schema 严格一致,不一致模型会反复调同一个工具试图"理解"。

反思:生成 → 评估 → 重写

…skeleton

answer = 生成(问题) # 第一版答案

while 评估(answer).分数 < 阈值: # 自己当质检员

answer = 重写(answer, 评估意见)

阈值必须设,否则白烧钱

两个设计点要强调:满意阈值必须设——反思不是免费的,我见过团队把反思开到 5 轮,结果 70% 的答案第一轮就是好的,白烧了 4 轮的钱;代码类任务自己反思就够,写作/方案类建议换裁判模型——让模型自己夸自己写的东西,和让人类自己夸自己一样不靠谱。

规划执行:规划器 + 执行器

…skeleton

plan = 规划器(任务) # 拆成步骤清单

for 步骤 in plan:

执行器(步骤) # 每步只带当前步骤上下文

某步失败 → 带着失败原因重新规划 (re-plan)

省 token 的秘密就在"每步只带当前步骤的上下文"——不用每次重放整个任务背景。但省下来的代价是灵活性:如果计划里第 2 步失败,后面步数全部作废。所以生产环境必须带 re-plan;没有 re-plan 的规划执行,就是个精致的纸老虎。

三版实测对比

同一个需求、同一个模型,在我本机各跑了一遍。数字是单次测试,模型和 temperature 都会影响,别当基准,但量级和趋势是稳的:

指标ReAct规划执行反思(+1 轮)
模型调用次数8610
token 消耗(约)42k18k55k
输出质量中,信息覆盖不错但有点跑偏中,步骤清晰但漏了 License 维度高,补漏删错
中途出错时自动调整下一步需显式 re-plan只能改文字,改不了已做动作

三个数字一摆,前面的"三种性格"就具象了:小 A(ReAct)最能随机应变但最费钱;小 B(反思)质量最高但也最慢最贵,而且它只能改稿子,改不了已经干出去的事;小 C(规划执行)最省钱但最怕意外;

04

PART

进阶思考:区别与组合

ARCHITECTURE · 怎么选,以及它们其实总在一起

先上一张完整的区别表,这是全文的核心,建议收藏:

维度ReActReflection规划执行
一句话定义边想边做,思考与行动交替先产出,再自我评估重写先规划步骤,再逐步执行
决策时机每步实时决策产出后再决策改不改开工前一次性决策
对外部信息依赖强,专为此设计弱,主要在文字层面打磨中,执行阶段需要
token 成本高,每步重发全量上下文中高,多几轮完整调用低,上下文按步精简
灵活性高,能根据中间结果转向中,只改进输出不改行为低,计划错了后面全错
典型翻车方式死循环、越查越偏过度反思改坏、自夸空转计划漏步骤、意外失败全崩
适合场景信息不确定、需边查边决定质量是生命线、可反复改步骤明确、可提前规划

三选一?不,生产环境都是组合拳

讲个反直觉的事:**真实生产环境里,几乎没有哪个正经 Agent 只用其中一种。**我见过的架构基本是这个套路:ReAct 是地基(任何需要调用工具的循环,默认就是它);复杂任务外层套规划执行把大方向定死,每个子步骤内部再跑 ReAct 应付细节;交付前最后加一轮反思做质检,把低级错误挡在门外。

**举个例子:**一个"自动写行业调研报告"的 Agent——规划执行负责定"搜什么→看什么→怎么写"的框架,每个"搜"的子步骤内部用 ReAct 决定搜什么词、看哪几页,最后整个报告生成完了,反思环节通读一遍补漏删错。三种性格各司其职,这才是 2026 年生产级 Agent 的真实长相。

我的 3 个判断问题

做技术选型时别问"哪个最好",问自己三个问题:

判断 1

任务需要外部信息、可能中途转向?

需要 → 用 ReAct。这是它唯一不可替代的价值。

判断 2

任务 70% 的步骤能提前确定?

能 → 认真考虑规划执行,token 直接省一半(上面实测 42k → 18k)。

判断 3

输出质量是生命线、且允许反复改?

是 → 加反思环节,但轮数压到 2 轮以内。

反思被严重高估了。80% 的质量提升在第一轮反思就拿到了,第二轮边际收益骤降,第三轮开始原地打转甚至改坏。它不是在"提高质量",而是在"花两倍的钱买 15% 的质量提升",值不值取决于场景。

规划执行被严重低估了。大部分人一上来就写 ReAct,因为它"最通用"。但很多任务根本不需要每步都重新思考——比如周报、批处理、定时报表这类结构固定的活。用规划执行 token 省一半,稳定性还更高,只是它的前提(任务结构稳定)经常被忽略,导致翻车后被一棍子打死。

2026 年的几点观察

**各家官方 SDK 默认给 ReAct。**Claude 的 computer-use、OpenAI 的 agent 都是,因为它最通用、最不会错。

**LangGraph 把规划执行图式化。**变成显式的图结构,你可以精确控制每个节点,代价是心智负担。

**反思正在被"外包"。**很多团队不再让 Agent 自我反思,而是用另一个模型甚至规则去质检,因为"自己查自己"天然不可靠。

**趋势是进一步融合。**框架帮你做组合,你只需要描述任务,架构由框架替你拼。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐