从「能说」到「能做」:一份理清 AI Agent 的学习笔记
最近集中啃了一批 AI 学习笔记——从大模型怎么工作,到 Agent 凭什么能"干活"
目录
MCP / Function Call / Agent / Skill
你有没有这样的感觉:ChatGPT 用得挺溜,但一说到 AI Agent、MCP、Skill、Function Call,脑子里就开始打架,分不清谁是谁?
我在 Notion 里攒了一批学习笔记,最近集中过了一遍,发现这些东西其实有一条清晰的脉络。今天把它串成一篇,争取用大白话讲明白:
大模型是怎么从"会聊天"变成"会干活"的。
一、先回到地基:大模型到底在干嘛
很多人以为大模型"懂"知识,其实它的本质机制特别朴素——预测下一个词(token)。
你说"今天天气真",它算出下一个最可能是"好"。仅此而已。但就是这个朴素的机制,配合海量数据和大规模训练,硬生生"涌现"出了理解和推理能力。
它的一生大致走四个阶段:
预训练:海量文本灌进去,学会语言生成
代码训练:代码的严谨结构给了它推理能力
监督微调(SFT):教它"像人一样"回答
RLHF:用人类反馈做强化学习,完成对齐
几个必须知道的词:
|
概念 |
一句话解释 |
|---|---|
|
Token |
模型处理文本的最小单位,一个汉字约占 1~2 个 token |
|
参数 |
模型里"存知识"的数字权重 |
|
上下文窗口 |
模型一次能"看见"的输入上限 |
|
温度 |
控制随机性:低→保守稳定,高→发散有创意 |
|
幻觉 |
编造不存在的事实——因为它是"猜",不是"查" |
把"幻觉"记牢。它解释了后来几乎所有 AI 翻车的名场面:模型不是在撒谎,它只是在认真猜测。
二、Agent 的真相:没有新智能,只是长了手和脚
"Agent 是不是比大模型更聪明?"
答案可能让你意外:Agent 没有新的智能,核心还是那个 LLM。它只是多了"手和脚"——能调用工具、能读写文件、能按流程执行。
一条公式概括:
Agent = LLM + 工具使用 + 外部记忆 + 规划分解
每一个加号背后都有代价:
工具使用:每多一个工具,就多一次"幻觉行动"的风险
外部记忆:突破了上下文窗口,但也可能"目标漂移"
规划分解:能把复杂任务拆成步骤,但错误也会级联放大
所以别把 Agent 当神话。它是个能干活但需要盯着的同事,不是全知全能的神。
三、四个概念别再搞混:MCP / Function Call / Agent / Skill
这是我最头疼的部分,现在用"一图一表"说清楚。
一句话记住它们:
|
概念 |
一句话定义 |
比喻 |
|---|---|---|
|
Skill |
教 AI 怎么做某类任务的方法论/知识包 |
技能书 |
|
Agent |
自主决策、编排任务的智能实体 |
智能工人 |
|
Function Call |
模型直接调用预定义函数的能力 |
瑞士军刀 |
|
MCP Server |
标准化连接外部系统/数据的服务 |
工具箱 |
它们在架构里的位置(从下往上):
外部世界(数据库 / API / 文件系统)
↑
集成层 MCP Server(连接外部世界) ← 工具箱
↑
推理层 LLM + Function Call(模型原生) ← 瑞士军刀
↑
知识层 Skill(教 AI 怎么做) ← 技能书
↑
编排层 Agent(自主决策、多步编排) ← 智能工人
一句话理清四者的分工:
Function Call:解决「决定做什么」
MCP:解决「怎么做到」(如何连接外部)
Skill:解决「怎么做得更好」(方法论)
Agent:解决「谁来做、如何统筹」
它们不是替代关系,而是互补关系。一个成熟的 Agent 系统,通常四者都要有。
怎么选? 按任务复杂度来:
简单 + 低延迟 → Function Call(查天气、翻译)
复杂 + 多源数据整合 → MCP Server(CRM、跨平台数据)
重复性工作流 + 内部规范 → Skill(代码审查、写作模板)
端到端 + 自主决策 → Agent(自动化客服、复杂任务)
四、Agent 的理论源头:ReAct 论文
聊到 Agent,绕不开一篇奠基论文——ReAct(ICLR 2023)。
它的核心思想一句话:让 LLM 边想边做。
以前的模型要么"只会想不会做"(纯推理),要么"只会做不会想"(纯行动)。ReAct 把它们交织在同一序列里,交替输出三种内容:
Thought(推理)→ Act(动作)→ Obs(环境反馈)
推理引导行动,行动反馈修正推理,互相增强。这听起来是不是特别像人?遇到问题先想想,然后动手,看结果不对再调整思路——ReAct 就是把人类"边做边想"的工作方式教给了模型。
效果也立得住:在具身决策任务 ALFWorld 上,成功率做到了 71%,显著高于只行动的基线(约 45%);在线购物任务 WebShop 上也明显领先模仿学习基线。
后来的 AutoGPT、LangChain Agent、各种 ReAct-style 框架,全都是它的徒子徒孙。如果你只看一篇 Agent 相关论文,就看这篇。
五、Skill 值得单独聊聊:让 AI 从通才变专家
如果说 Agent 是工人,Skill 就是给工人配的技能证书。
一个 Skill 就是一个文件夹,包含三要素:
SKILL.md:说明书(什么时候用、怎么用、注意什么)
Script:可执行脚本
Reference:参考文档、模板
它把领域知识、操作流程、工具调用和最佳实践打包成"技能包",让 AI 从"什么都懂一点"变成"某个领域的熟手"。
为什么 Skill 不烧 Token? 因为它采用三层渐进式加载:
L1 元数据:启动时只扫"名片"(名称+描述),约 100 Token/个
L2 说明文档:技能被触发时才加载完整 SKILL.md,低于 5000 Token
L3 资源/代码:按需用 bash 读取,根本不进上下文
相当于 AI 面前有一个"名片夹",它先翻名片判断要不要用你,再翻开说明书,最后才去查附录。省 Token,还省上下文。
Skill 和 Command、MCP 的区别(厨房比喻):
Command = 微波炉的"指定按钮":用户主动触发,固定单一功能
MCP = 厨房里的"单一厨具":提供外部能力,但什么时候用由模型判断
Skill = 完整"菜谱":定义流程+工具+最佳实践,模型自动匹配
怎么写好一个 Skill? 记住五条心法:
原子性:小而美,像积木一样可复用组合
给例子(最关键):Few-shot 示例让模型秒懂格式和风格
立规矩:定角色 + 拆步骤 + 画红线(禁止什么)
造接口:像设计 API 一样定义输入参数和输出格式
勤复盘:把翻车案例变成新规则,持续迭代
一个实用建议:Skills 不生效?十有八九是 Description 没写好——Agent 全靠描述判断何时调用你。
六、抬头看路:Stanford AI Index 2026 的关键信号
学技术的同时,也要知道这行在往哪走。斯坦福《AI Index Report 2026》(全球公认最权威的 AI 全景报告,2026 年 4 月发布,统计截至 2025 年)的几个关键信号,我挑最有感的讲:
中美模型差距缩到 2.7%——顶级模型能力几乎并驾齐驱,AI 不再是美国单极格局
中国在论文和专利上领先——AI 出版物数量、专利数量位居全球第一
AI 采用速度超过 PC 和互联网——渗透速度成为史上最快的一轮技术扩散
初级编程岗受冲击——25 岁以下程序员岗位大幅缩水,AI 正在重新定义"什么工作会被替代"
投资狂热与残酷现实并存——投资总额暴涨,但利润向头部集中(20% 的公司攫取了 74% 的 AI 利润),大量早期项目折戟
进入"落地考验期"——模型不再稀缺,真正稀缺的是算力、场景和信任
最让我记住的是第 4 条和第 6 条的呼应:纯拼"会写代码"的窗口在收窄,而"把 AI 落到真实场景、并赢得信任"的价值在放大。 对普通人来说,这反而是个机会——懂一个行业 + 会用 AI,比单打独斗学编程更有竞争力。
数据说明:本节已更新为 2026 版报告(2026 年 4 月发布,统计截至 2025 年)。引用来源:斯坦福 HAI《AI Index Report 2026》及相关中文解读。
七、最后:一些可以直接用的方法论
笔记里最有价值的部分,其实是几套能直接上手的方法。
1、交付闭环 4 步法(让 AI 干活前的固定动作):
清晰目标:定义"我要什么"
明确约束:定义"不要什么",设好边界
AI 自主执行:在框架内让它充分发挥
审查结果:人来验收质量,迭代反馈
目标越清晰、约束越明确,AI 越能自主发挥;越模糊,就越要收紧控制。
2、想用好 AI,练这 5 种能力(Architect 五能力):
C1 清晰沟通意图:把想法翻译成 AI 可执行的指令
C2 拆解复杂目标:大任务拆成小任务,逐步可控
C3 验证输出质量:判断结果对不对,建立质量闭环
C4 编排多步流程:让多个 AI 工具协同完成工作流
C5 沉淀复用经验:把成功经验变成可复用的模板
3、两种人机协作模式,按需选择:
半人马式(Centaur):人和 AI 分工明确,人决定何时切换;清晰可控,适合责任边界敏感的工作
赛博格式(Cyborg):人与 AI 深度融合;效率高,但人容易失去控制感
我的建议:先用 Centaur 跑通流程,再逐步尝试更深融合。
结尾:AI 的定位,说到底是"搭档"不是"替身"
AI 更适合做"搭档":AI 做初稿、穷举、角色扮演,人做方向、判断、取舍。
它能替你写一万字初稿,但"这篇稿子的立场是什么"得你来定; 它能穷举一百种方案,但"选哪个"得你拍板; 它能扮演任何角色陪你演练,但"现实里要怎么办"得你负责。
保持主动提问,避免被动接收。 这大概是用好 AI 最重要的一条心法。
如果你也在学 AI,可以试着给自己列一张行动清单:
每次让 AI 做事,先写清楚:目标(要什么)+ 约束(不要什么)+ 验收标准
先把一个流程用"半人马"模式跑通,再谈深度融合
凡是会"真的做事、影响外部"的输出,必须人工审查一遍
共勉。
主要参考:ReAct 论文(ICLR 2023)、Stanford AI Index Report 2026、Anthropic Skills 机制、TRAE《一文读懂 Skills》及相关学习笔记。
注:关键数据已进行核对,确保准确。
更多推荐



所有评论(0)