从"能聊天"到"能干活",AI 的下一个形态


1. 前言

Agent 还有一个中文名字叫做“智能体”
Agent在最近一年火速出圈,它其实可以理解为是一个没有实体的一个“人”,能够感知环境、独立决策、自主行动。、


2. 什么是 Agent

Agent = 大脑(LLM)+ 手(工具)+ 眼睛(感知)

  • 大脑:GPT-4、Claude 等大模型,负责"思考"——理解用户意图、决定下一步做什么
  • :工具,比如查天气 API、搜索引擎、计算器、文件读写
  • 眼睛:感知环境,比如读取用户输入、获取系统状态、接收工具返回的结果

三者的协作流程是:

在这里插入图片描述


3. 一个具体的例子

假设你问 Agent:“帮我查一下北京明天的天气,然后告诉我穿什么衣服合适。”

整个过程是这样的:

步骤角色发生了什么
1大脑理解到用户想知道"北京明天的天气"和"穿衣建议"
2大脑决定调用"查天气"工具,参数是"北京"
3执行天气 API,返回"明天 15-22°C,小雨"
4大脑看到天气信息,结合常识推理:15-22°C 小雨需要薄外套+带伞
5大脑输出回答:“北京明天 15-22°C,小雨,建议穿薄外套,出门记得带伞。”

注意关键点:第 2 步和第 4 步都是大脑完成的。大脑既负责"决定做什么",也负责"分析结果做什么"。这就是 Agent 和普通 API 调用的本质区别——Agent 有自主决策能力


4. 生活中的 Agent

其实 Agent 并不神秘,我们每天都在用:

产品你怎么用Agent 做了什么
Siri / 小爱同学“帮我设个 10 分钟的闹钟”语音识别 → 理解意图 → 调用系统闹钟 API
自动驾驶设定目的地摄像头感知 → 路径规划 → 控制方向盘和油门
推荐系统刷抖音/小红书收集你的行为数据 → 分析兴趣 → 推荐内容
智能客服问"我的快递到哪了"识别意图 → 查数据库 → 返回物流信息

这些系统本质上都是 Agent:感知输入 → 内部决策 → 执行动作 → 反馈结果

不同的是,以前这些 Agent 是用规则写死的(if-else),而现在的 AI Agent 是用大模型做"大脑",决策能力更强、更灵活。


5. Agent vs 普通 LLM 调用

之前我也分不清"用 API 调大模型"和"Agent"的区别,现在一张表说明:

对比项普通 LLM 调用AI Agent
输入只有文本文本 + 环境状态(文件、数据库、传感器等)
输出只有文本文本 + 工具调用(可以执行操作)
决策能力无,只会生成文字有,能决定"该做什么"
工具使用不能能调用 API、执行代码、访问文件
状态管理无状态,每次独立有状态,可多轮交互
自主性被动回答主动完成任务

简单记忆

  • 普通 LLM:你问它答,它只动嘴
  • Agent:你给它目标,它自己想办法完成,既动脑又动手
Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐