AI Agent 开篇
1、AI Agent 用通俗易懂的社会关系描述
AI 项目 === 一家公司
Agent:智能体 === 公司内员工
LLM:大模型 === 员工的脑子
API:接口 === 员工的神经系统
Skill:技能 === 员工已经学习完可实践的技能
RAG:检索增强 === 员工可查阅的知识中心
MCP:模型上下文协议 === 员工可对接外部部门统一标准
Tool:工具 === 员工完成工作需要借助的工具
Token:词元 === 员工思考/沟通时的最小语言单位(字/词)
Context:上下文 === 员工的一次会议或会谈产生的记忆
LTM:长期记忆 === 员工将记忆转化为书面记录
Harness:马鞍 === 员工准则,告诉员工什么能干,什么不能干
System Prompt:系统提示词 === 员工的岗位职责说明书
2、AI 关键词描述
Token: 大模型理解和生成文本时的最小语义单元,也是AI计费与算力消耗的基本计量单位
Prompt: 用户输入给大模型的指令
LLM: 基于海量数据训练出的概率预测引擎,负责理解提示词并生成回复
Agent: 能根据提示词自己拆任务、做编排、调工具的AI控制器
API: AI的接入通道
Context: 一次会话中能看到的记忆信息
LTM: 每次会话检索才能唤醒的过往记忆信息
Embedding:把文本转换为便于计算相似度的向量信息
RAG: 根据相似度检索外部资料,将其注入提示词作为‘开卷考’依据,再生成回答
Tool: AI 可使用的工具
MCP: AI 连接外部统一工具库的协议
Function Calling:让 AI 不再去瞎推测,而是告诉 AI 你该接住什么工具得到自己所需要资料
多模态:在懂文字的基础上,还能读懂图片、视频、语音等提示词
AIGC: AI 最终生成的内容
幻觉: AI 在缺乏事实依据时,自信生成的虚假或似是而非的内容
3、AI 核心架构全景分层图(输入 → 大脑 → 记忆 → 工具 → 输出)
| 层级 | 角色定位 | 包含关键词 | 一句话概括本层职责 |
|---|---|---|---|
| L5 输出与评判层 | 公司的“质检总监” | AIGC、幻觉 | 负责产出最终成品(AIGC),同时对产出的真实性进行风险把控(防幻觉)。 |
| L4 工具与执行层 | 员工的“四肢与标准化接口” | Tool、Function Calling、MCP | 当大脑决定要干活时,通过标准化协议(MCP)精准调用工具(Tool)取数或执行动作。 |
| L3 核心推理层 | 员工的“大脑皮层” | LLM、Token、Context | 真正的“算力心脏”。消耗Token进行推理,并在当前工作记忆(Context)内处理信息。 |
| L2 记忆与增强层 | 员工的“知识库与档案室” | LTM、Embedding、RAG | 将海量文本向量化(Embedding),平时锁在柜子里(LTM),遇到问题时主动翻阅(RAG)并喂给大脑。 |
| L1 输入与调度层 | 公司的“前台与项目经理” | Prompt、多模态、API、Agent | 接收各种形式的指令(文字/语音/视频),由Agent拆解任务,并通过API接入系统。 |
4、AI Agent 学习路线图(从入门到实战)
学习原则:先会用,再懂原理,最后做工程化。每个阶段都有明确的「检验标准」,能做出东西才算过关。
🎯 阶段总览
| 阶段 | 主题 | 掌握关键词 | 一句话目标 | 对应课程 |
|---|---|---|---|---|
| S0 | 认知筑基 | 本文全部概念 | 能用"公司类比"向外行讲清 AI 项目全貌 | 第 01~02 课 |
| S1 | 单点调用 | LLM、API、Prompt、Token | 让模型稳定输出结构化数据(JSON),而不只是聊天 | 第 03 课 |
| S2 | 流程编排 | 多步流程、条件分支 | 把多次模型调用串成流水线,完成一个完整任务 | 第 04~05 课 |
| S3 | 工具调用 | Tool、Function Calling | 让模型自己决定"何时调用哪个工具",告别瞎猜 | 第 06 课 |
| S4 | Agent 化 | Agent、工具池、动态装载 | 管理 Agent 的行动能力:注册工具、按需装载 | 第 07 课 |
| S5 | 标准化生态 | MCP(Server/Client/Host) | 用统一协议对接外部工具库,不再每个工具写一套对接代码 | 第 08 课 |
| S6 | 记忆增强 | Embedding、RAG、LTM | 给 Agent 装上"档案室":向量化存储、相似度检索、长期记忆 | 进阶扩展 |
| S7 | 工程化落地 | 幻觉防控、评估、成本 | 防幻觉、控 Token 成本、可观测,把 Demo 变成产品 | 进阶扩展 |
📌 各阶段要点与检验标准
S1 单点调用 —— 一切的地基
-
核心认知:LLM 是"概率预测引擎",结构化输出是用 Prompt 约束 + Schema 校验 驯服概率的第一步
-
✅ 检验:输入一段非结构化文本,稳定得到符合 Schema 的 JSON,失败能自动重试
S2 流程编排 —— 从"一次调用"到"一个系统"
-
核心认知:复杂任务 = 多个简单任务的编排;上一步的输出是下一步的输入
-
✅ 检验:独立完成「科技新闻简报」实战(抓取 → 摘要 → 结构化 → 成稿)
S3 工具调用 —— Agent 的"手"
-
核心认知:Function Calling 的本质是让模型输出结构化的调用意图,真正执行的还是你的代码
-
✅ 检验:模型能根据用户问题自主决定是否查天气/查新闻,并正确传参
S4~S5 Agent 化与 MCP —— 从"写死流程"到"自主决策"
-
核心认知:S2 是人编排流程,S4 起是模型自己规划(思考 → 行动 → 观察 循环);MCP 让工具接入标准化
-
✅ 检验:给 Agent 一个开放性目标,它能自主选工具、多轮迭代直到完成任务
S6 记忆增强 —— 突破上下文窗口的限制
-
核心认知:Context 是有限的会议记忆,RAG + LTM 让 Agent 拥有"无限外挂记忆"
-
✅ 检验:搭建一个能记住历史偏好、可查询私有知识库的问答 Agent
S7 工程化 —— Demo 与产品的分水岭
-
核心认知:幻觉无法根除只能管控(引用溯源、置信度、人工兜底);Token 即成本
-
✅ 检验:为自己的 Agent 写出评估集,能说清"准确率多少、单次成本多少"
🗺️ 用架构图回看路线
L5 输出评判层 ←────────── S7 工程化(终点:可信的 AIGC) L4 工具执行层 ←──── S3 工具调用 → S4 Agent 化 → S5 MCP L3 核心推理层 ←── S1 单点调用(地基中的地基) L2 记忆增强层 ←────────── S6 RAG / LTM L1 输入调度层 ←── S0 认知 → S2 流程编排
学习顺序本质上是自底向上逐层解锁:先把 L3 的"大脑"用熟,再向两边扩展"记忆"与"四肢",最后由 L5 把控产出质量。
5、学习误区与避坑指南
误区按「学习阶段」组织,对应第 4 节的 S0~S7 路线,方便对号入座。
🧠 认知类误区(S0 阶段最容易犯)
| 误区 | 真相 | 一句话纠正 |
|---|---|---|
| ❌ 把 Agent 当成"更聪明的 ChatGPT" | Agent 的核心不是"更聪明",而是能拆任务、调工具、多轮迭代 | 聊天是单程票,Agent 是往返多次还带工具的行程 |
| ❌ 认为 Prompt 写得好就万事大吉 | Prompt 只是 L1 入口,没有工具、记忆、编排,Prompt 再强也只是一个"会说不会做的员工" | Prompt 决定下限,架构决定上限 |
| ❌ 上来就问"该学哪个框架"(LangChain / AutoGen / Agently...) | 框架是封装的范式,不理解底层 API 和 Function Calling,框架出问题只能干瞪眼 | 先用原生 API 手搓一遍,再让框架帮你提效 |
💻 实践类误区(S1~S3 最容易犯)
| 误区 | 真相 | 一句话纠正 |
|---|---|---|
| ❌ 只跑通 Demo 就跳过 | 单次成功 ≠ 稳定可用,模型的概率本质意味着"这次行下次可能不行" | 同一个输入跑 10 次,9 次成功才算过关 |
| ❌ 期望模型"自觉"输出合法 JSON | 不做 Schema 校验和失败重试,结构化输出必然在生产环境翻车 | 永远假设模型会输出垃圾,代码层兜底 |
| ❌ 以为 Function Calling 是"模型在执行函数" | 模型只输出调用意图的 JSON,真正执行的是你写的代码 | 模型是"下指令的",不是"干活的" |
| ❌ 把工具结果一股脑塞回上下文 | 工具返回几千字原文直接喂回去,Token 爆炸还干扰推理 | 工具返回前先做裁剪/摘要 |
🏗️ 架构类误区(S4~S7 最容易犯)
| 误区 | 真相 | 一句话纠正 |
|---|---|---|
| ❌ 什么任务都想用 Agent 自主规划 | 确定性流程硬上 Agent,成本高、延迟大、结果不可控 | 能写死流程(S2 编排)就别让模型自由发挥 |
| ❌ 上下文塞得越多越好 | Context 不是垃圾桶,无关信息会稀释模型的注意力,"lost in the middle" | 上下文管理的本质是做减法 |
| ❌ 指望 RAG 解决一切幻觉 | RAG 只解决"知识缺失"型幻觉,解决不了"推理错误"和"过度自信" | 防幻觉要靠检索 + 校验 + 人工兜底组合拳 |
| ❌ 忽视成本闷头开发 | 多轮 Agent 循环的 Token 消耗是单次调用的几十倍,上线即破产 | 从第一天起就统计每次任务的 Token 成本 |
| ❌ 收藏了 = 学会了 | 看 10 篇教程不如亲手踩 1 个坑 | 每个阶段用第 4 节的「检验标准」自查 |
🎯 最核心的一条
"把概率系统当确定性系统用"是所有误区的总根源。 传统编程里
1+1永远等于 2;LLM 的世界里同样输入可能得到不同输出。理解了这一点,校验、重试、评估、兜底这些"麻烦事"才会变成你的本能。
更多推荐



所有评论(0)