一文看懂 AI 技术栈
理解总结:大模型是空壳子,bot让大模型具有记忆,agent(智能体)调用各种工具,mcp(协议)帮助agent调用工具,skill就是说明书,具有强大的能力,可以调用mcp,openclaw(智能体)可以接入skill。AI的能力取决于它接入了哪些skill。
第一层:大模型(LLM)—— 没有记忆和手脚的 "超级大脑"
我们最先接触到的 AI,其实就是大模型本身。你可以把它想象成一个读遍了互联网所有公开知识、拥有超强语言能力,但没有记忆、没有身体、也不能主动做任何事的大脑。
它的工作原理其实很简单
- 底层核心是Transformer 架构,这是 2017 年谷歌提出的神经网络结构,它的 "自注意力机制" 让模型能同时理解一句话里所有词之间的关系,这是大模型能理解人类语言的关键。
- 当你输入一个问题时,它不会 "思考",而是通过神经网络一层一层地计算,预测下一个最可能出现的词,然后一个词一个词地拼接成完整的回复。
- 本质上,它是一个概率生成器,而不是一个 "知识库"。它不知道什么是 "对",只知道什么是 "看起来最合理"。
这就带来了它最核心的两个局限性
- 没有记忆:每一次对话都是独立的。你上一句刚告诉它你叫张三,下一句它可能就忘了。我们平时用的 ChatGPT 看起来有记忆,其实是每次对话都把之前的所有聊天记录重新发给它一遍。
- 会产生幻觉:因为它是靠概率生成内容,当它不知道答案时,不会说 "我不知道",而是会编造一个看起来很合理的假答案。这也是大模型最被人诟病的问题。
大模型的能力边界很清晰:它能理解语言、生成文本、总结归纳、逻辑推理,但它不能获取实时信息,不能执行任何操作,也记不住你说过的话。
第二层:Bot(聊天机器人)—— 给大脑装上 "记忆"
为了解决大模型没有记忆的问题,人们在大模型外面包了一层,这就是Bot(聊天机器人)。
Bot 的工作流程
- 接收用户发送的消息
- 从数据库中检索和这个用户相关的历史聊天记录(记忆)
- 把 "系统提示词 + 历史记忆 + 用户当前问题" 拼接成一个完整的提示词
- 调用大模型生成回复
- 把这次的对话内容保存到数据库中,更新记忆
- 把回复返回给用户
简单来说,Bot 就是一个 "带记忆的大模型包装器"。它自己不生成内容,所有的回复还是大模型生成的,它只是负责帮大模型记住之前发生过什么。
现在我们用的大多数 AI 助手,本质上都是 Bot。比如你可以让它记住你的饮食偏好、工作习惯,下次对话时它就会基于这些信息给你更个性化的回复。
但 Bot 的局限性依然很明显
它只能做和 "对话" 相关的事。你让它写文案、做总结、出主意,它都能做得很好,但如果你让它 "帮我查一下今天的天气"、"帮我发一封邮件"、"帮我订一张明天去上海的机票",它就做不到了。
因为它只能和大模型对话,不能和外部世界交互。
第三层:Agent(智能体)—— 给大脑装上 "手脚"
为了让 AI 能真正 "做事",人们又在 Bot 的基础上增加了工具调用能力,这就诞生了Agent(智能体)。
Agent 的核心突破:能调用工具
Agent 和 Bot 最大的区别在于,它不仅能和大模型对话,还能调用外部的工具和接口来获取信息或执行操作。
比如你问 Agent:"今天长沙的天气怎么样?"
- Agent 收到问题后,会先判断:这个问题需要实时信息,大模型自己不知道
- 它会调用 "天气查询工具",传入参数 "城市 = 长沙"
- 工具返回真实的天气数据:"长沙今天晴,气温 18-25℃"
- Agent 把这个数据和你的问题一起发给大模型
- 大模型生成自然语言的回复:"今天长沙天气晴朗,气温 18 到 25 摄氏度,非常适合外出。"
这就是一个最简单的 Agent 工作流程。除了天气查询,Agent 还可以调用各种各样的工具:
- 搜索引擎:获取最新的新闻和资讯
- 代码解释器:执行代码,进行数学计算和数据分析
- 邮件接口:发送和接收邮件
- 日历接口:创建日程和提醒
- 支付接口:完成支付操作
Agent 的三大核心组件
一个完整的 Agent 通常由三个部分组成:
- 规划器:负责理解用户的目标,把复杂的任务拆解成多个步骤,决定每一步该做什么、该调用什么工具
- 记忆系统:和 Bot 一样,负责存储历史对话和任务进度
- 工具调用模块:负责和外部工具进行交互,传递参数和获取结果
Agent 的出现,是 AI 发展史上的一个里程碑。它第一次让 AI 从 "只能说话" 变成了 "能做事",从一个 "聊天伙伴" 变成了一个 "个人助理"。
第四层:MCP(模型上下文协议)—— 给所有工具做一个 "通用插座"
Agent 虽然强大,但有一个非常头疼的问题:工具集成太麻烦了。
不同的工具提供商有不同的接口规范、不同的认证方式、不同的参数格式。如果你想让你的 Agent 能调用 10 个不同的工具,你就得为每个工具写一套单独的集成代码,这是一个非常耗时耗力的工作。
而且,不同的大模型(GPT、Claude、豆包)的工具调用格式也不一样。你为 GPT 写的工具集成代码,放到 Claude 上就用不了。
为了解决这个问题,Anthropic 在 2025 年推出了MCP(Model Context Protocol,模型上下文协议)。
MCP 是什么?
你可以把 MCP 想象成一个通用插座。只要工具和 Agent 都遵守 MCP 协议,它们之间就能无缝连接,不需要再写任何定制化的集成代码。
MCP 的工作原理
- MCP 采用客户端 - 服务器架构:Agent 是客户端,工具是服务器
- 它定义了一套标准化的消息格式,用于 Agent 和工具之间的通信
- 工具可以自动向 Agent 暴露自己的功能、参数和使用说明
- Agent 可以自动发现和调用任何符合 MCP 协议的工具
MCP 带来的革命性变化
- 一次开发,到处运行:工具开发者只需要按照 MCP 协议开发一次,就能被所有支持 MCP 的 Agent 调用
- 自动工具发现:Agent 不需要预先知道有哪些工具,它可以自动发现并使用可用的工具
- 统一的安全模型:MCP 提供了统一的认证和授权机制,解决了工具调用的安全问题
- 跨模型兼容:不管你用的是 GPT、Claude 还是豆包,只要支持 MCP,就能调用所有 MCP 工具
MCP 的出现,彻底解决了 Agent 工具集成的痛点。它正在快速成为 AI 行业的事实标准,未来所有的 AI 工具和 Agent 都会支持 MCP 协议。
第五层:Agent Skill—— 给智能体装上 "预制技能包"
MCP 解决了 "调用工具" 的问题,但还有一个问题没有解决:告诉 Agent 怎么用工具。
如果你想让 Agent 帮你预订机票,你不能只说 "帮我订机票"。你得告诉它:
- 先调用航班查询工具,查询符合条件的航班
- 把航班列表展示给用户,让用户选择
- 调用乘客信息工具,获取用户的身份证号和联系方式
- 调用机票预订接口,提交订单
- 调用支付接口,完成支付
- 把预订成功的信息发送给用户
这一整套流程,你都得通过提示词详细地告诉 Agent。而且提示词写得越详细,Agent 执行得越好。但写这样的长提示词是一件非常繁琐的事情,而且很容易出错。
为了解决这个问题,人们提出了 **Agent Skill(智能体技能)** 的概念。
Agent Skill 是什么?
简单来说,Agent Skill 就是一个封装了复杂任务流程的 "预制技能包"。它是一个文档,里面定义了:
- 这个技能是用来做什么的(元数据)
- 什么时候应该调用这个技能(触发条件)
- 完成这个任务需要哪些步骤(工作流)
- 每一步需要调用什么工具,传入什么参数
- 如何处理可能出现的错误和异常
Skill 的优势
- 可复用:一个技能写好之后,可以被任何 Agent 使用,也可以在不同的任务中重复使用
- 可组合:多个简单的技能可以组合成一个更复杂的技能。比如 "预订机票"+"预订酒店"+"预订出租车" 可以组合成 "安排商务旅行"
- 降低提示词复杂度:你不需要再写长长的提示词告诉 Agent 怎么做,只需要告诉它 "用预订机票技能帮我订明天去北京的机票" 就行了
- 提升可靠性:技能是经过测试和优化的,比临时写的提示词更可靠,出错的概率更低
Skill 的出现,让 Agent 的开发进入了 "模块化" 时代。未来的 Agent 不会是一个什么都懂的全能型选手,而是由一个个专门的 Skill 组成的。你需要什么能力,就给你的 Agent 装上对应的 Skill 就行了。
总结:AI 的演进之路,就是不断给 "大脑" 赋能的过程
我们回顾一下这条完整的演进路线:
- 大模型:一个没有记忆、没有手脚的超级大脑,只能靠概率生成文本
- Bot:给大脑装上了记忆,能记住你说过的话,提供个性化的对话
- Agent:给大脑装上了手脚,能调用工具和外部世界交互,真正帮你做事
- MCP:给所有工具做了一个通用插座,让 Agent 能轻松调用任何工具
- Agent Skill:给智能体装上了预制技能包,让复杂任务的执行变得简单可靠
这五个层次,一层比一层更高级,一层比一层更接近我们理想中的 AI。
更多推荐

所有评论(0)