今日 GitHub 第一:李博杰开源《深入理解 AI Agent》,一本书吃透
技趣星球 · 用技术创造乐趣。
2026-07-30

2026 年 7 月,一本中文 AI Agent 开源书以单周近 1.6 万 Star 的速度冲上 GitHub Trending 榜首。它不是又一本"AI 科普读物",而是一本工程师写给工程师的教科书——作者李博杰把"能跑的 Agent Demo"和"可靠的生产级 Agent"之间的鸿沟,一条条拆给你看。
这本书叫《深入理解 AI Agent:设计原理与工程实践》,开源在 GitHub 上,全书正文、配图和 93 个配套实验全部免费。截至 2026 年 7 月,它已经拿到 21,000+ Star、2,100+ Fork,支持 9 种语言,Apache 2.0 协议。
这篇文章不写读后感,只做深度拆解:作者是谁?书里到底讲了什么?这 93 个实验怎么设计的?为什么它能在这么多 AI Agent 书籍中杀出来?
如果你曾被 Agent Demo 和 production 之间的落差坑过,或者正在想把 Agent 从玩具变成可用工具,这篇文章值得你花 10 分钟看完。
一、作者李博杰:从华为"天才少年"到 Pine AI 首席科学家
在谈书之前,必须先了解作者。李博杰的履历本身就说明了为什么这本书能写透。
他是首届华为"天才少年",曾任华为计算机网络与协议实验室助理科学家,中科院计算所研究员。离开华为后,他加入 AI Agent 创业公司 Pine AI,担任首席科学家 [ $TRAE_REF ](http://m.toutiao.com/group/7665954594245132841/)[ $TRAE_REF ](http://m.toutiao.com/group/7665163309485687323/)。
这种背景意味着两件事:
- 他懂研究:中科院和华为的经历让他有能力把 Agent 原理讲清楚,而不是停留在 API 调用层面。
- 他懂落地:作为 Pine AI 首席科学家,他每天在做的事就是让 Agent 从 Demo 变成可用的产品。这本书的很多内容,其实是他在解决真实工程问题的笔记。
市面上很多 Agent 书籍要么是学术派(公式多、代码少),要么是速成派(只教怎么调 API)。李博杰这本书的稀缺性在于:他同时具备研究和工程的双重视角。
二、核心公式:Agent = LLM + 上下文 + 工具
全书只围绕一个公式展开:
Agent = LLM + 上下文 + 工具
这不是口号。它在全书 10 章里被反复拆解、验证、工程化:
- LLM 是大脑(第 1、7 章)
- 上下文是记忆和工作区(第 2、3 章)
- 工具是双手(第 4、5 章)
这个公式的简洁性恰恰是它的高明之处。很多书会给你讲 50 个概念,但读完你还是不知道 Agent 到底是什么。这本书先把骨架给你,再填肉。
2.1 LLM:不是越强越好
第 1 章和第 7 章专门讲模型选型。作者的态度很明确:没有最好的模型,只有最适合任务的模型。
他分析了 SFT(监督微调)和 RL(强化学习)的适用场景:
- 需要模型遵循格式、调用工具 → 选 SFT
- 需要模型在复杂推理中做对决策 → 选 RL
- 样本效率低、数据少 → 优先 SFT
- 有足够反馈信号 → 可以尝试 RL
这种工程化的选型逻辑,比"用最强模型"的建议实际得多。
2.2 上下文:决定能力上限
第 2 章讲上下文工程,这是全书的第一个技术高潮。
作者把上下文拆成四层:
- KV Cache:缓存机制,减少重复计算
- 提示工程:系统提示词、少样本、思维链
- Agent Skills:可复用的技能模板
- 上下文压缩:摘要、剪枝、检索
最实用的是第 4 点。作者给出了具体的压缩策略:
- 滑动窗口:只保留最近 N 轮对话
- 摘要压缩:用 LLM 把长对话压缩成摘要
- 检索增强:从知识库中检索相关片段
这些策略的代码实现都在配套实验里,可以直接跑。
2.3 工具:Agent 的双手
第 4 章讲工具,重点介绍了 MCP(Model Context Protocol) 协议。
MCP 是 Anthropic 提出的标准,让 AI 模型可以统一调用各种外部工具。作者不仅讲了 MCP 是什么,还讲了什么时候该用工具、什么时候不该用。
他的分类很有实操价值:
- 感知类工具:读文件、查数据库、访问网页
- 执行类工具:写文件、发消息、运行代码
- 协作类工具:把任务拆给其他 Agent
关键洞察:工具越多,Agent 不一定越强。工具过多会导致选择困难、上下文爆炸、错误率上升。作者给出了"工具 generality 边界"的概念——每个工具应该有明确的职责边界,而不是大而全。
三、10 章内容全景:从 Demo 到生产
全书 10 章,形成一个完整的学习路径 [ $TRAE_REF ](https://github.com/bojieli/ai-agent-book)。
- 章 | 主题 | 核心问题 | 配套实验
- 1 | Agent 基础知识 | Agent 到底是什么? | 4
- 2 | 上下文工程 | 如何管理上下文窗口? | 9
- 3 | 用户记忆和知识库 | 如何让 Agent 记住用户? | 13
- 4 | 工具 | 如何设计和使用工具? | 7
- 5 | Coding Agent | 如何让 Agent 写代码? | 12
- 6 | Agent 评估 | 如何衡量 Agent 好不好? | 11
- 7 | 模型后训练 | 如何让模型更适合 Agent? | 16
- 8 | Agent 持续进化 | 如何让 Agent 从经验中学习? | 8
- 9 | 多模态与实时交互 | 如何处理语音、图像、GUI? | 7
- 10 | 多 Agent 协作 | 如何让多个 Agent 协同工作? | 7
93 个实验,70+ 可独立运行。这意味着你不需要把整本书看完才能动手——挑感兴趣的章节,直接跑实验。
3.1 第 5 章:Coding Agent 全景
这是我认为最有价值的一章。
作者把 Coding Agent 分成三层:
- 代码补全:像 GitHub Copilot 那样,在当前光标位置补全代码
- 代码生成:根据自然语言描述生成完整函数或文件
- 自主编程:Agent 自己拆解任务、写代码、运行测试、修复 bug
每一层都有对应的开源项目分析:
- 代码补全:TabNine、CodeGeeX
- 代码生成:CodeLlama、StarCoder
- 自主编程:OpenDevin、SWE-agent、Claude Code
作者的结论是:当前阶段,代码补全最成熟,自主编程最受关注但最不稳定。如果你要在生产环境用,优先考虑补全+人工审核的模式。
3.2 第 6 章:Agent 评估
作者提出了一个核心观点:没有度量,就没有改进。他把 Agent 评估分成三个层次:
- 任务完成率:Agent 有没有完成用户给定的任务
- 效率指标:用了多少轮对话、多少 token、多长时间
- 质量指标:输出是否准确、是否安全、是否符合用户偏好
更实用的是他给出的统计显著性检验方法。很多开发者跑一次 benchmark 就下结论,但作者告诉你:单次结果可能是运气,要做多次实验、算置信区间。
3.3 第 7 章:模型后训练
这一章技术深度最高,适合有一定 ML 基础的读者。
作者详细对比了三种训练范式:
- 预训练:从零开始训练基础模型(成本极高,不适合大多数人)
- SFT:用标注数据微调,让模型学会特定格式或行为
- RLHF/RL:用人类反馈或奖励模型优化模型
他的核心建议是:
- 大部分场景,SFT 就够了。RL 的成本和复杂度被高估了。
- 工具调用内化:通过 SFT 让模型学会调用工具,比让模型在推理时"即兴发挥"稳定得多。
- 样本效率:好的 SFT 数据(100-1000 条)比大量的 RL 训练更有效。
四、93 个实验:不是Demo,是工程模板
这本书最特别的地方是实验设计 [ $TRAE_REF ](https://github.com/bojieli/ai-agent-book)。
很多开源书也有配套代码,但往往是"能跑就行"的 Demo。这本书的实验有几个特点:
4.1 可独立运行
70+ 实验可以独立运行,不需要依赖其他章节。这意味着你可以按需学习,而不是被迫从头读到尾。
4.2 工程化而非学术化
实验代码的风格不是"学术原型",而是接近生产级。例如:
- 有
requirements.txt管理依赖 - 有错误处理和日志
- 有配置文件,支持不同 API Key
- 有 README 说明运行步骤
这种代码风格说明作者真正在意读者能否把实验变成自己项目的一部分。
4.3 实验类型多样化
实验分为三类:
- ✅ 可运行:完整实现,可以直接跑
- 📖 复现:复现论文或开源项目的核心逻辑
- 🚧 设计:给出设计思路和伪代码,需要读者自行实现
这种分层设计照顾了不同水平的读者。
4.4 外部仓库集成
第 6、7、9、10 章的 19 个外部仓库未内置(出于体积与版权),但作者提供了一键克隆脚本:
git clone https://github.com/google-research/android_world.git chapter6/android_world
git clone https://huggingface.co/datasets/gaia-benchmark/GAIA chapter6/GAIA
第 7 章 · 训练框架
git clone https://github.com/bojieli/minimind.git chapter7/MiniMind-pretrain/minimind
git clone https://github.com/bojieli/AdaptThink.git chapter7/AdaptThink-original
这些仓库包括 Google 的 AndroidWorld、GAIA 评测基准、MiniMind 训练框架等,都是业界标准工具。作者不是让你看书本上的简化版,而是直接对接真实生态。
五、多语言与社区:9 种语言,872 次提交
这本书的社区活跃度远超普通开源书。
5.1 9 种语言
中文原版之外,已有 8 种社区翻译:
- 英文(by @nsdevaraj、@whanyu1212)
- 繁體中文(台灣)(by @tigercosmos)
- 俄语(by @ui99ru)
- 泰米尔语(by @nsdevaraj)
- 越南语(by @toanalien)
- 日语(by @eltociear)
- 阿拉伯语(by @TheSyBuilder)
- 土耳其语(by @memisemre)
这种翻译广度说明这本书的内容具有跨文化价值——Agent 工程不是中文圈独有的问题。
5.2 持续更新
截至 2026 年 7 月 29 日,仓库已有 872 次提交,最近一次更新是合并土耳其语翻译的 PR。这说明项目处于活跃维护状态,不是"发布即弃用"。
5.3 Apache 2.0 协议
采用 Apache 2.0 开源协议,意味着:
- 可以自由使用、修改、分发
- 可以商用
- 需要保留原作者的版权声明
这与很多"非商业用途免费"的书籍形成鲜明对比。作者的态度是:知识应该自由流动。
六、这本书与其他资源的对比
市面上 Agent 相关资源很多,这本书的差异化在哪里?
- 资源 | 形式 | 语言 | 实验 | 深度 | 适用人群
- 《深入理解 AI Agent》 | 开源书 | 中文 | 93 个 | ⭐⭐⭐⭐⭐ | 工程师、研究者
- 《动手学 AI Agent》 | 在线教程 | 中文 | 较少 | ⭐⭐⭐ | 初学者
- LangChain 官方文档 | 文档 | 英文 | 示例 | ⭐⭐⭐⭐ | 开发者
- 《Building Agentic Applications》 | 视频课程 | 英文 | 较少 | ⭐⭐⭐ | 产品经理
- CS 229T: Trustworthy ML | 课程 | 英文 | 作业 | ⭐⭐⭐⭐⭐ | 研究者
这本书的独特之处在于深度和工程化的结合。它不是入门读物,也不是纯学术教材,而是面向工程师的实战指南。
如果你已经会用 API 调用 LLM,想深入理解 Agent 的设计原理和工程实践,这本书是当前中文圈少有的系统性选择。
七、如何高效阅读这本书
作者在仓库里专门有一篇 [学习建议](https://github.com/bojieli/ai-agent-book/blob/main/docs/zh-CN/LEARNING.md),我总结出三条核心建议:
7.1 按需阅读,不必从头到尾
10 章内容相对独立。如果你主要做 Coding Agent,重点读第 1、4、5 章;如果你关心模型训练,重点读第 7 章。
7.2 实验优先,代码要跑
作者反复强调:看十遍不如跑一遍。93 个实验中有 70+ 可以独立运行,建议边读边跑。遇到不懂的参数,去代码里找答案。
7.3 结合自己的项目
最好的学习方式是把书中的方法用到你的实际项目中。例如:
- 读第 2 章时,想想你的 Agent 上下文管理有什么问题
- 读第 4 章时,重新设计你现有 Agent 的工具集
- 读第 6 章时,为你的 Agent 建立评估体系
八、我的判断:这本书为什么值得你花时间
最后说点主观的。
我见过太多 Agent 相关的开源项目,大部分是框架(比如 LangChain、AutoGen),或者是一个能跑的 Demo。框架教你"怎么用",Demo 展示"能做什么",但很少有人告诉你"为什么这样设计"以及"生产环境会遇到什么问题"。
李博杰这本书填补了这个空白。它不教你调 API,它教你像工程师一样思考 Agent。
具体来说,这本书有三个不可替代的价值:
- 系统性强:10 章覆盖 Agent 从基础到生产的完整链路,不是零散技巧的集合。
- 工程视角:作者真正在做 Agent 产品,所以讲的内容都是经过实战检验的。
- 开源免费:93 个实验全部开源,Apache 2.0 协议,没有门槛。
如果你是一个想深入理解 AI Agent 的开发者,或者你已经在用 Agent 但想把它从 Demo 变成产品,这本书值得你花 20-30 小时精读+实操。
九、快速开始
- GitHub 仓库:[https://github.com/bojieli/ai-agent-book](https://github.com/bojieli/ai-agent-book)
- 在线阅读:[https://bojieli.github.io/ai-agent-book/](https://bojieli.github.io/ai-agent-book/)(支持多语言切换、全文搜索)
- PDF 下载:[中文版 PDF](https://github.com/bojieli/ai-agent-book/releases/download/latest/AI-Agents-in-Depth-zh-CN.pdf)
- EPUB 下载:[中文版 EPUB](https://github.com/bojieli/ai-agent-book/releases/download/latest/AI-Agents-in-Depth-zh-CN.epub)
- 学习建议:[LEARNING.md](https://github.com/bojieli/ai-agent-book/blob/main/docs/zh-CN/LEARNING.md)
你怎么看这本书?有没有读过?欢迎在评论区交流。
本文作者:技趣星球
原文链接:https://github.com/bojieli/ai-agent-book
版权声明:本书为开源项目,采用 Apache 2.0 协议。
下一步建议: 先不用急着通读全书,去 GitHub 仓库 clone 第 2 章的上下文压缩实验跑一遍,感受一下这本书的实操风格,再决定要不要按需精读其他章节。
更多推荐

所有评论(0)