最近集中啃了一批 AI 学习笔记——从大模型怎么工作,到 Agent 凭什么能"干活"

目录

大模型到底在干嘛

Agent 的真相

MCP / Function Call / Agent / Skill

ReAct 论文

Skill 为什么值得单独聊

Stanford AI Index 2026

可直接用的方法论

你有没有这样的感觉:ChatGPT 用得挺溜,但一说到 AI Agent、MCP、Skill、Function Call,脑子里就开始打架,分不清谁是谁?

我在 Notion 里攒了一批学习笔记,最近集中过了一遍,发现这些东西其实有一条清晰的脉络。今天把它串成一篇,争取用大白话讲明白:

大模型是怎么从"会聊天"变成"会干活"的。

一、先回到地基:大模型到底在干嘛

很多人以为大模型"懂"知识,其实它的本质机制特别朴素——预测下一个词(token)。

你说"今天天气真",它算出下一个最可能是"好"。仅此而已。但就是这个朴素的机制,配合海量数据和大规模训练,硬生生"涌现"出了理解和推理能力。

它的一生大致走四个阶段:

预训练:海量文本灌进去,学会语言生成

代码训练:代码的严谨结构给了它推理能力

监督微调(SFT):教它"像人一样"回答

RLHF:用人类反馈做强化学习,完成对齐

几个必须知道的词:

概念

一句话解释

Token

模型处理文本的最小单位,一个汉字约占 1~2 个 token

参数

模型里"存知识"的数字权重

上下文窗口

模型一次能"看见"的输入上限

温度

控制随机性:低→保守稳定,高→发散有创意

幻觉

编造不存在的事实——因为它是"猜",不是"查"

把"幻觉"记牢。它解释了后来几乎所有 AI 翻车的名场面:模型不是在撒谎,它只是在认真猜测。

二、Agent 的真相:没有新智能,只是长了手和脚

"Agent 是不是比大模型更聪明?"

答案可能让你意外:Agent 没有新的智能,核心还是那个 LLM。它只是多了"手和脚"——能调用工具、能读写文件、能按流程执行。

一条公式概括:

Agent = LLM + 工具使用 + 外部记忆 + 规划分解

每一个加号背后都有代价:

工具使用:每多一个工具,就多一次"幻觉行动"的风险

外部记忆:突破了上下文窗口,但也可能"目标漂移"

规划分解:能把复杂任务拆成步骤,但错误也会级联放大

所以别把 Agent 当神话。它是个能干活但需要盯着的同事,不是全知全能的神。

三、四个概念别再搞混:MCP / Function Call / Agent / Skill

这是我最头疼的部分,现在用"一图一表"说清楚。

一句话记住它们:

概念

一句话定义

比喻

Skill

教 AI 怎么做某类任务的方法论/知识包

技能书

Agent

自主决策、编排任务的智能实体

智能工人

Function Call

模型直接调用预定义函数的能力

瑞士军刀

MCP Server

标准化连接外部系统/数据的服务

工具箱

它们在架构里的位置(从下往上):

外部世界(数据库 / API / 文件系统)

                                                                               ↑

集成层 MCP Server(连接外部世界) ← 工具箱

                                                                              ↑

推理层 LLM + Function Call(模型原生) ← 瑞士军刀

                                                                              ↑

知识层 Skill(教 AI 怎么做) ← 技能书

                                                                              ↑

编排层 Agent(自主决策、多步编排) ← 智能工人

一句话理清四者的分工:

Function Call:解决「决定做什么」

MCP:解决「怎么做到」(如何连接外部)

Skill:解决「怎么做得更好」(方法论)

Agent:解决「谁来做、如何统筹」

它们不是替代关系,而是互补关系。一个成熟的 Agent 系统,通常四者都要有。

怎么选? 按任务复杂度来:

简单 + 低延迟 → Function Call(查天气、翻译)

复杂 + 多源数据整合 → MCP Server(CRM、跨平台数据)

重复性工作流 + 内部规范 → Skill(代码审查、写作模板)

端到端 + 自主决策 → Agent(自动化客服、复杂任务)

四、Agent 的理论源头:ReAct 论文

聊到 Agent,绕不开一篇奠基论文——ReAct(ICLR 2023)。

它的核心思想一句话:让 LLM 边想边做。

以前的模型要么"只会想不会做"(纯推理),要么"只会做不会想"(纯行动)。ReAct 把它们交织在同一序列里,交替输出三种内容:

Thought(推理)→ Act(动作)→ Obs(环境反馈)

推理引导行动,行动反馈修正推理,互相增强。这听起来是不是特别像人?遇到问题先想想,然后动手,看结果不对再调整思路——ReAct 就是把人类"边做边想"的工作方式教给了模型。

效果也立得住:在具身决策任务 ALFWorld 上,成功率做到了 71%,显著高于只行动的基线(约 45%);在线购物任务 WebShop 上也明显领先模仿学习基线。

后来的 AutoGPT、LangChain Agent、各种 ReAct-style 框架,全都是它的徒子徒孙。如果你只看一篇 Agent 相关论文,就看这篇。

五、Skill 值得单独聊聊:让 AI 从通才变专家

如果说 Agent 是工人,Skill 就是给工人配的技能证书。

一个 Skill 就是一个文件夹,包含三要素:

SKILL.md:说明书(什么时候用、怎么用、注意什么)

Script:可执行脚本

Reference:参考文档、模板

它把领域知识、操作流程、工具调用和最佳实践打包成"技能包",让 AI 从"什么都懂一点"变成"某个领域的熟手"。

为什么 Skill 不烧 Token? 因为它采用三层渐进式加载

L1 元数据:启动时只扫"名片"(名称+描述),约 100 Token/个

L2 说明文档:技能被触发时才加载完整 SKILL.md,低于 5000 Token

L3 资源/代码:按需用 bash 读取,根本不进上下文

相当于 AI 面前有一个"名片夹",它先翻名片判断要不要用你,再翻开说明书,最后才去查附录。省 Token,还省上下文。

Skill 和 Command、MCP 的区别(厨房比喻):

Command = 微波炉的"指定按钮":用户主动触发,固定单一功能

MCP = 厨房里的"单一厨具":提供外部能力,但什么时候用由模型判断

Skill = 完整"菜谱":定义流程+工具+最佳实践,模型自动匹配

怎么写好一个 Skill? 记住五条心法:

原子性:小而美,像积木一样可复用组合

给例子(最关键):Few-shot 示例让模型秒懂格式和风格

立规矩:定角色 + 拆步骤 + 画红线(禁止什么)

造接口:像设计 API 一样定义输入参数和输出格式

勤复盘:把翻车案例变成新规则,持续迭代

一个实用建议:Skills 不生效?十有八九是 Description 没写好——Agent 全靠描述判断何时调用你。

六、抬头看路:Stanford AI Index 2026 的关键信号

学技术的同时,也要知道这行在往哪走。斯坦福《AI Index Report 2026》(全球公认最权威的 AI 全景报告,2026 年 4 月发布,统计截至 2025 年)的几个关键信号,我挑最有感的讲:

中美模型差距缩到 2.7%——顶级模型能力几乎并驾齐驱,AI 不再是美国单极格局

中国在论文和专利上领先——AI 出版物数量、专利数量位居全球第一

AI 采用速度超过 PC 和互联网——渗透速度成为史上最快的一轮技术扩散

初级编程岗受冲击——25 岁以下程序员岗位大幅缩水,AI 正在重新定义"什么工作会被替代"

投资狂热与残酷现实并存——投资总额暴涨,但利润向头部集中(20% 的公司攫取了 74% 的 AI 利润),大量早期项目折戟

进入"落地考验期"——模型不再稀缺,真正稀缺的是算力、场景和信任

最让我记住的是第 4 条和第 6 条的呼应:纯拼"会写代码"的窗口在收窄,而"把 AI 落到真实场景、并赢得信任"的价值在放大。 对普通人来说,这反而是个机会——懂一个行业 + 会用 AI,比单打独斗学编程更有竞争力。

数据说明:本节已更新为 2026 版报告(2026 年 4 月发布,统计截至 2025 年)。引用来源:斯坦福 HAI《AI Index Report 2026》及相关中文解读。

七、最后:一些可以直接用的方法论

笔记里最有价值的部分,其实是几套能直接上手的方法。

1、交付闭环 4 步法(让 AI 干活前的固定动作):

清晰目标:定义"我要什么"

明确约束:定义"不要什么",设好边界

AI 自主执行:在框架内让它充分发挥

审查结果:人来验收质量,迭代反馈

目标越清晰、约束越明确,AI 越能自主发挥;越模糊,就越要收紧控制。

2、想用好 AI,练这 5 种能力(Architect 五能力):

C1 清晰沟通意图:把想法翻译成 AI 可执行的指令

C2 拆解复杂目标:大任务拆成小任务,逐步可控

C3 验证输出质量:判断结果对不对,建立质量闭环

C4 编排多步流程:让多个 AI 工具协同完成工作流

C5 沉淀复用经验:把成功经验变成可复用的模板

3、两种人机协作模式,按需选择:

半人马式(Centaur):人和 AI 分工明确,人决定何时切换;清晰可控,适合责任边界敏感的工作

赛博格式(Cyborg):人与 AI 深度融合;效率高,但人容易失去控制感

我的建议:先用 Centaur 跑通流程,再逐步尝试更深融合。

结尾:AI 的定位,说到底是"搭档"不是"替身"

AI 更适合做"搭档":AI 做初稿、穷举、角色扮演,人做方向、判断、取舍。

它能替你写一万字初稿,但"这篇稿子的立场是什么"得你来定; 它能穷举一百种方案,但"选哪个"得你拍板; 它能扮演任何角色陪你演练,但"现实里要怎么办"得你负责。

保持主动提问,避免被动接收。 这大概是用好 AI 最重要的一条心法。

如果你也在学 AI,可以试着给自己列一张行动清单:

每次让 AI 做事,先写清楚:目标(要什么)+ 约束(不要什么)+ 验收标准

先把一个流程用"半人马"模式跑通,再谈深度融合

凡是会"真的做事、影响外部"的输出,必须人工审查一遍

共勉。

主要参考:ReAct 论文(ICLR 2023)、Stanford AI Index Report 2026、Anthropic Skills 机制、TRAE《一文读懂 Skills》及相关学习笔记。

注:关键数据已进行核对,确保准确。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐