案头上这本“袋鼠书”曾被我冷落过一段时间。前阵子因为深陷 OpenClaw 小龙虾开发无法自拔,几乎把所有精力都耗在了养龙虾上,直到最近逻辑卡壳,才想起重新翻开这本书。

带着实践中的困惑回过头看理论,视角却完全变了。这一次我不打算按部就班地从扉页读起,而是直接给 AI 抛出了一个极其务实的命题:“如果我现在只关心 Agent 开发,这本书该从哪儿下手?”

AI 建议我先从第六章提示工程开始读起。以前容易把提示词优化当成是一种技巧,清晰描述需求、或者加一些约束,可以让模型表现得更稳定些。

第 6 章对提示工程的讲解非常实用,哪怕你只是日常使用 ChatGPT,也能从中学到设计 prompt 的思路。

其中“Tree of Thought”的方法让人印象深刻,一个简单的模板就能引导模型展开多条思路,非常适合任务拆解。

图片

利用树状结构,生成模型可以生成待评分的中间思考过程。最有希望的思考过程会被保留,而较差的会被剪枝

这次读下来,觉得提示词不只是要把话说严谨,从工程角度看,更像是建立一套规范,定义输入、边界约束,尤其是结构化输出和校验,输出能遵循特定格式,程序才能更好的处理,对 Agent 来说,后续的链、工具调用等,都依赖稳定的输出。

一个设计好的提示词,只能解决单次调用的稳定性,而我们大部分的任务,并不是一次问答就能完成的。当任务需要拆分成多步骤,并且前后结果需要稳定衔接时,就需要用到链了。

链可以让流程变得可控,每一步的输入输出,都可以提前定义好,单个步骤更容易调试和优化,这样出了问题时,也方便排查。

模型本身不保留跨对话信息,如果任务缺少历史上下文,模型无法关联前文信息,输出偏差会影响后续任务正确执行。要想多步任务稳定运行,还需要引入记忆机制。书中介绍了 3 种记忆保存方式,对话缓冲区、窗口式对话缓冲区和对话摘要。

记忆机制需要根据具体任务做选择,本质是对上下文长度、完整性、维护成本之间进行取舍。

在链和记忆之后,通过工具调用与 RAG,模型分别获得了操作外部服务和获取外部知识的能力,从而能够与外部环境进行交互。

有了以上的基础功能,模型就具备了执行复杂任务的能力,但这还不能等同于 Agent ,还需要一套决策机制,把这些能力组织成一个可协同运作的系统。

书中介绍的  ReAct 思考框架,是一种“思考、行动、观察”的循环,每一步先思考再执行,根据结果调整下一步操作,这种循环机制把前面的能力都串联起来,让系统完成动态决策和工具调用,从而具备  Agent 的核心能力。

这本书的图解部分对理解很有帮助。大模型相关概念本身比较抽象,加上书中代码量还不少,如果只读文字或直接看代码,很容易陷入细节,反而忘了整体结构。

图示的好处是能让复杂流程变得更直观,比如 LangChain 模块如何组织连接、ReAct 的决策过程、RAG 如何从检索走到生成等等。以后复习时再看到这些图,很多概念之间的关系也能很快重新串起来。

图片

LangChain 作为全功能 LLM 应用框架,其模块化组件可通过链式架构构建复杂的 LLM 系统

看完这些原理知识点之后,怎么判断自己是不是真的吸收了?这本书的译者附带了一份常见面试题,我觉得不要当成面试八股文来看,它更适合作为一份自测清单。

合上书之后再回头看这些问题,如果能想起相关知识点,说明自己至少建立了基本印象,如果还能进一步说清楚它们的含义、适用场景和彼此之间的关系,才算是真正把内容消化了。

总之,不管你现在处于模型开发的任何阶段,这本书我都推荐你好好读一读~

图片

《图解大模型:生成式AI原理与实战》

[沙特] 杰伊·阿拉马尔,[荷] 马尔滕·格鲁滕多斯特 | 著

李博杰 | 译

备受关注的大模型“袋鼠书”,全书通过 300 幅全彩插图,以极致视觉化的方式呈现大模型的核心原理与工程实现,覆盖从底层机制、应用开发到性能优化的完整链条。内容结合真实数据集、实用项目与典型场景,注重实操性。

特别收录 18 幅图精解 DeepSeek 底层原理,紧跟前沿。配套资源包括一键运行代码、200 道大模型面试题及大量拓展视频/文章资料,助你全面掌握大模型理论与实践,是入门进阶与求职备战的理想之选。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐