理解总结:大模型是空壳子,bot让大模型具有记忆,agent(智能体)调用各种工具,mcp(协议)帮助agent调用工具,skill就是说明书,具有强大的能力,可以调用mcp,openclaw(智能体)可以接入skill。AI的能力取决于它接入了哪些skill。

第一层:大模型(LLM)—— 没有记忆和手脚的 "超级大脑"

我们最先接触到的 AI,其实就是大模型本身。你可以把它想象成一个读遍了互联网所有公开知识、拥有超强语言能力,但没有记忆、没有身体、也不能主动做任何事的大脑

它的工作原理其实很简单

  • 底层核心是Transformer 架构,这是 2017 年谷歌提出的神经网络结构,它的 "自注意力机制" 让模型能同时理解一句话里所有词之间的关系,这是大模型能理解人类语言的关键。
  • 当你输入一个问题时,它不会 "思考",而是通过神经网络一层一层地计算,预测下一个最可能出现的词,然后一个词一个词地拼接成完整的回复。
  • 本质上,它是一个概率生成器,而不是一个 "知识库"。它不知道什么是 "对",只知道什么是 "看起来最合理"。

这就带来了它最核心的两个局限性

  1. 没有记忆:每一次对话都是独立的。你上一句刚告诉它你叫张三,下一句它可能就忘了。我们平时用的 ChatGPT 看起来有记忆,其实是每次对话都把之前的所有聊天记录重新发给它一遍。
  2. 会产生幻觉:因为它是靠概率生成内容,当它不知道答案时,不会说 "我不知道",而是会编造一个看起来很合理的假答案。这也是大模型最被人诟病的问题。

大模型的能力边界很清晰:它能理解语言、生成文本、总结归纳、逻辑推理,但它不能获取实时信息,不能执行任何操作,也记不住你说过的话

第二层:Bot(聊天机器人)—— 给大脑装上 "记忆"

为了解决大模型没有记忆的问题,人们在大模型外面包了一层,这就是Bot(聊天机器人)

Bot 的工作流程

  1. 接收用户发送的消息
  2. 从数据库中检索和这个用户相关的历史聊天记录(记忆)
  3. 把 "系统提示词 + 历史记忆 + 用户当前问题" 拼接成一个完整的提示词
  4. 调用大模型生成回复
  5. 把这次的对话内容保存到数据库中,更新记忆
  6. 把回复返回给用户

简单来说,Bot 就是一个 "带记忆的大模型包装器"。它自己不生成内容,所有的回复还是大模型生成的,它只是负责帮大模型记住之前发生过什么。

现在我们用的大多数 AI 助手,本质上都是 Bot。比如你可以让它记住你的饮食偏好、工作习惯,下次对话时它就会基于这些信息给你更个性化的回复。

但 Bot 的局限性依然很明显

它只能做和 "对话" 相关的事。你让它写文案、做总结、出主意,它都能做得很好,但如果你让它 "帮我查一下今天的天气"、"帮我发一封邮件"、"帮我订一张明天去上海的机票",它就做不到了。

因为它只能和大模型对话,不能和外部世界交互。

第三层:Agent(智能体)—— 给大脑装上 "手脚"

为了让 AI 能真正 "做事",人们又在 Bot 的基础上增加了工具调用能力,这就诞生了Agent(智能体)

Agent 的核心突破:能调用工具

Agent 和 Bot 最大的区别在于,它不仅能和大模型对话,还能调用外部的工具和接口来获取信息或执行操作。

比如你问 Agent:"今天长沙的天气怎么样?"

  1. Agent 收到问题后,会先判断:这个问题需要实时信息,大模型自己不知道
  2. 它会调用 "天气查询工具",传入参数 "城市 = 长沙"
  3. 工具返回真实的天气数据:"长沙今天晴,气温 18-25℃"
  4. Agent 把这个数据和你的问题一起发给大模型
  5. 大模型生成自然语言的回复:"今天长沙天气晴朗,气温 18 到 25 摄氏度,非常适合外出。"

这就是一个最简单的 Agent 工作流程。除了天气查询,Agent 还可以调用各种各样的工具:

  • 搜索引擎:获取最新的新闻和资讯
  • 代码解释器:执行代码,进行数学计算和数据分析
  • 邮件接口:发送和接收邮件
  • 日历接口:创建日程和提醒
  • 支付接口:完成支付操作

Agent 的三大核心组件

一个完整的 Agent 通常由三个部分组成:

  1. 规划器:负责理解用户的目标,把复杂的任务拆解成多个步骤,决定每一步该做什么、该调用什么工具
  2. 记忆系统:和 Bot 一样,负责存储历史对话和任务进度
  3. 工具调用模块:负责和外部工具进行交互,传递参数和获取结果

Agent 的出现,是 AI 发展史上的一个里程碑。它第一次让 AI 从 "只能说话" 变成了 "能做事",从一个 "聊天伙伴" 变成了一个 "个人助理"。

第四层:MCP(模型上下文协议)—— 给所有工具做一个 "通用插座"

Agent 虽然强大,但有一个非常头疼的问题:工具集成太麻烦了

不同的工具提供商有不同的接口规范、不同的认证方式、不同的参数格式。如果你想让你的 Agent 能调用 10 个不同的工具,你就得为每个工具写一套单独的集成代码,这是一个非常耗时耗力的工作。

而且,不同的大模型(GPT、Claude、豆包)的工具调用格式也不一样。你为 GPT 写的工具集成代码,放到 Claude 上就用不了。

为了解决这个问题,Anthropic 在 2025 年推出了MCP(Model Context Protocol,模型上下文协议)

MCP 是什么?

你可以把 MCP 想象成一个通用插座。只要工具和 Agent 都遵守 MCP 协议,它们之间就能无缝连接,不需要再写任何定制化的集成代码。

MCP 的工作原理

  • MCP 采用客户端 - 服务器架构:Agent 是客户端,工具是服务器
  • 它定义了一套标准化的消息格式,用于 Agent 和工具之间的通信
  • 工具可以自动向 Agent 暴露自己的功能、参数和使用说明
  • Agent 可以自动发现和调用任何符合 MCP 协议的工具

MCP 带来的革命性变化

  1. 一次开发,到处运行:工具开发者只需要按照 MCP 协议开发一次,就能被所有支持 MCP 的 Agent 调用
  2. 自动工具发现:Agent 不需要预先知道有哪些工具,它可以自动发现并使用可用的工具
  3. 统一的安全模型:MCP 提供了统一的认证和授权机制,解决了工具调用的安全问题
  4. 跨模型兼容:不管你用的是 GPT、Claude 还是豆包,只要支持 MCP,就能调用所有 MCP 工具

MCP 的出现,彻底解决了 Agent 工具集成的痛点。它正在快速成为 AI 行业的事实标准,未来所有的 AI 工具和 Agent 都会支持 MCP 协议。

第五层:Agent Skill—— 给智能体装上 "预制技能包"

MCP 解决了 "调用工具" 的问题,但还有一个问题没有解决:告诉 Agent 怎么用工具

如果你想让 Agent 帮你预订机票,你不能只说 "帮我订机票"。你得告诉它:

  1. 先调用航班查询工具,查询符合条件的航班
  2. 把航班列表展示给用户,让用户选择
  3. 调用乘客信息工具,获取用户的身份证号和联系方式
  4. 调用机票预订接口,提交订单
  5. 调用支付接口,完成支付
  6. 把预订成功的信息发送给用户

这一整套流程,你都得通过提示词详细地告诉 Agent。而且提示词写得越详细,Agent 执行得越好。但写这样的长提示词是一件非常繁琐的事情,而且很容易出错。

为了解决这个问题,人们提出了 **Agent Skill(智能体技能)** 的概念。

Agent Skill 是什么?

简单来说,Agent Skill 就是一个封装了复杂任务流程的 "预制技能包"。它是一个文档,里面定义了:

  • 这个技能是用来做什么的(元数据)
  • 什么时候应该调用这个技能(触发条件)
  • 完成这个任务需要哪些步骤(工作流)
  • 每一步需要调用什么工具,传入什么参数
  • 如何处理可能出现的错误和异常

Skill 的优势

  1. 可复用:一个技能写好之后,可以被任何 Agent 使用,也可以在不同的任务中重复使用
  2. 可组合:多个简单的技能可以组合成一个更复杂的技能。比如 "预订机票"+"预订酒店"+"预订出租车" 可以组合成 "安排商务旅行"
  3. 降低提示词复杂度:你不需要再写长长的提示词告诉 Agent 怎么做,只需要告诉它 "用预订机票技能帮我订明天去北京的机票" 就行了
  4. 提升可靠性:技能是经过测试和优化的,比临时写的提示词更可靠,出错的概率更低

Skill 的出现,让 Agent 的开发进入了 "模块化" 时代。未来的 Agent 不会是一个什么都懂的全能型选手,而是由一个个专门的 Skill 组成的。你需要什么能力,就给你的 Agent 装上对应的 Skill 就行了。

总结:AI 的演进之路,就是不断给 "大脑" 赋能的过程

我们回顾一下这条完整的演进路线:

  1. 大模型:一个没有记忆、没有手脚的超级大脑,只能靠概率生成文本
  2. Bot:给大脑装上了记忆,能记住你说过的话,提供个性化的对话
  3. Agent:给大脑装上了手脚,能调用工具和外部世界交互,真正帮你做事
  4. MCP:给所有工具做了一个通用插座,让 Agent 能轻松调用任何工具
  5. Agent Skill:给智能体装上了预制技能包,让复杂任务的执行变得简单可靠

这五个层次,一层比一层更高级,一层比一层更接近我们理想中的 AI。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐