《AI Agent 自学指北》第 1 篇:什么是 AI Agent?
·
从"能聊天"到"能干活",AI 的下一个形态
1. 前言
Agent 还有一个中文名字叫做“智能体”
Agent在最近一年火速出圈,它其实可以理解为是一个没有实体的一个“人”,能够感知环境、独立决策、自主行动。、
2. 什么是 Agent
Agent = 大脑(LLM)+ 手(工具)+ 眼睛(感知)
- 大脑:GPT-4、Claude 等大模型,负责"思考"——理解用户意图、决定下一步做什么
- 手:工具,比如查天气 API、搜索引擎、计算器、文件读写
- 眼睛:感知环境,比如读取用户输入、获取系统状态、接收工具返回的结果
三者的协作流程是:

3. 一个具体的例子
假设你问 Agent:“帮我查一下北京明天的天气,然后告诉我穿什么衣服合适。”
整个过程是这样的:
| 步骤 | 角色 | 发生了什么 |
|---|---|---|
| 1 | 大脑 | 理解到用户想知道"北京明天的天气"和"穿衣建议" |
| 2 | 大脑 | 决定调用"查天气"工具,参数是"北京" |
| 3 | 手 | 执行天气 API,返回"明天 15-22°C,小雨" |
| 4 | 大脑 | 看到天气信息,结合常识推理:15-22°C 小雨需要薄外套+带伞 |
| 5 | 大脑 | 输出回答:“北京明天 15-22°C,小雨,建议穿薄外套,出门记得带伞。” |
注意关键点:第 2 步和第 4 步都是大脑完成的。大脑既负责"决定做什么",也负责"分析结果做什么"。这就是 Agent 和普通 API 调用的本质区别——Agent 有自主决策能力。
4. 生活中的 Agent
其实 Agent 并不神秘,我们每天都在用:
| 产品 | 你怎么用 | Agent 做了什么 |
|---|---|---|
| Siri / 小爱同学 | “帮我设个 10 分钟的闹钟” | 语音识别 → 理解意图 → 调用系统闹钟 API |
| 自动驾驶 | 设定目的地 | 摄像头感知 → 路径规划 → 控制方向盘和油门 |
| 推荐系统 | 刷抖音/小红书 | 收集你的行为数据 → 分析兴趣 → 推荐内容 |
| 智能客服 | 问"我的快递到哪了" | 识别意图 → 查数据库 → 返回物流信息 |
这些系统本质上都是 Agent:感知输入 → 内部决策 → 执行动作 → 反馈结果。
不同的是,以前这些 Agent 是用规则写死的(if-else),而现在的 AI Agent 是用大模型做"大脑",决策能力更强、更灵活。
5. Agent vs 普通 LLM 调用
之前我也分不清"用 API 调大模型"和"Agent"的区别,现在一张表说明:
| 对比项 | 普通 LLM 调用 | AI Agent |
|---|---|---|
| 输入 | 只有文本 | 文本 + 环境状态(文件、数据库、传感器等) |
| 输出 | 只有文本 | 文本 + 工具调用(可以执行操作) |
| 决策能力 | 无,只会生成文字 | 有,能决定"该做什么" |
| 工具使用 | 不能 | 能调用 API、执行代码、访问文件 |
| 状态管理 | 无状态,每次独立 | 有状态,可多轮交互 |
| 自主性 | 被动回答 | 主动完成任务 |
简单记忆:
- 普通 LLM:你问它答,它只动嘴
- Agent:你给它目标,它自己想办法完成,既动脑又动手
更多推荐


所有评论(0)