AI Agent是什么

AI Agent(人工智能体,俗称“智能代理”)不是简单的“大模型问答机”,而是一座**「感知 → 思考 → 记忆 → 行动」**的闭环“小机器人”。它像人一样能:

  1. 看/听/输入(感知)

  2. 想明白要干啥(规划)

  3. 记住之前说过的事(记忆)

  4. 动手干——调接口、发邮件、点鼠标、下单、发推(行动)

AI Agent具备独立思考并调用工具,逐步实现既定目标的能力。

把 LLM 当作它的大脑,再加四件套,就组成了一个最小可运行的 AI Agent。

场景 感知 思考 记忆 行动
旅行 Agent 读取用户语音“我想去京都看樱花” 拆分任务:查机票→查酒店→查花期→做行程 记住预算 5 k、对“早班机”过敏 自动在 Skyscanner 下单、发确认邮件到邮箱
股票 Agent 爬取财经新闻、Twitter 情绪 判断“某芯片股负面情绪>70%”→决策卖出 记录持仓成本、止损线 调用券商 API 下单卖出
运维 Agent 监控告警“CPU>90%” 推理“最近上线了新模型”→回滚版本 记录上次回滚耗时 3 min 执行 K8s 命令 kubectl rollout undo

跟“大模型聊天”有何不同?

维度 大模型问答 AI Agent
目标 一次性生成文本 完成多步骤、跨系统任务
记忆 当前对话窗口 长期记忆+向量数据库
行动 只给建议 直接动手调接口/点鼠标
结果 说完即结束 可循环、自迭代、直到目标达成

总的来说,Agent能感知所处环境,自主作出决策并采取行动,以实现既定目标,更关键特征它可以通过学习或获取新知识来提升自己。在面对复杂或不断变化任务时,能够更加灵活和适应。

大模型在Agent起到作用

大模型通过训练包含丰富多样的数据和人类行为数据的庞大数据集,具备了模拟人类的交互能力。随着模型规模不断扩大,它们展现出了上下文学习能力、思维链、推理能力等,这些都是类似于人类思考方式的能力。这些能力使得大模型能够更好地理解和处理复杂任务。

例如将一个复杂任务拆解成多个可执行的子任务。因此,将大模型作为AIAgent的核心大脑,可以构建出具备自主思考、决策和执行任务能力的智能体。

基于LLM的AI Agent系统组成

大脑模型 = LLM +  记忆  +  任务规划

基于LLM的AI Agent系统

感知模块 = 信息输入

感知能力不仅仅局限文本,而是一个融合文字、听觉和视觉等多种模态丰富多元领域。能像人一样感知和理解周围世界。

行动模块(tool use + action)

AI Agent调用的外部工具,旨在将决策和规划转为具体行动。

AI Agent通过学习调用外部API补充模型权重中缺失的额外信息:

1. 当前信息、代码执行能力、对特定信息源的访问等

2. 物理世界中控制机械臂、移动设备等

3. 数字世界中RPA(机器人流程自动化)工具启动,发送软件等软件操作。

Agent的历史发展

1950────1980────2000────2012────2020────2023→
符号     机器     深度     强化     大模型
“木偶”  “学步”  “感知”  “动手”  “数字员工”

① 符号规则期(1950s‑1980s)——“木偶 Agent”

  • 核心:IF-THEN 规则库 + 推理机

  • 代表:ELIZA(1966)、MYCIN(1972)

  • 能力:在限定领域答固定问题,毫无学习力

  • 瓶颈:规则靠人写,一旦出界就宕机,被嘲“专家系统不专家”


② 机器学习期(1990s‑2010s)——“学步 Agent”

  • 核心:监督/无监督学习 → 自己挖特征

  • 代表:1997 深蓝击败卡斯帕罗夫、Roomba 扫地机

  • 突破:首次用数据“喂”出能力,不再纯手工写规则

  • 瓶颈:依赖大量标注,泛化差,跨任务要重新训练


③ 深度学习期(2012‑2019)——“感知 Agent”

  • 核心:CNN/RNN 自动特征 + GPU 算力

  • 代表:2016 AlphaGo、AlexNet、智能客服

  • 突破:图像、语音、翻译全面超人类平均水平

  • 瓶颈:仍只能“看”或“听”,不会“动手”,缺行动闭环


④ 强化+工具期(2020‑2022)——“动手 Agent”

  • 核心:RL 学策略 + API 调外部世界

  • 代表:OpenAI Five、WebGPT、AlphaStar

  • 突破:在环境里试错,自己学会下单、搜索、玩游戏

  • 瓶颈:训练成本高,任务稍变就得重训,难泛化到真实工作流


⑤ 大模型驱动期(2023‑至今)——“数字员工 Agent”

  • 核心:LLM 当“大脑”+ 函数调用/工作流当“手脚”

  • 代表:AutoGPT、LangChain、Devin、扣子(coze)

  • 突破
    – 零样本规划:用语言就能把任务拆成步骤
    – 工具即插即用:会查表、会发邮件、会点鼠标
    – 多 Agent 协作:评审、编码、测试角色各自上岗

  • 新瓶颈:幻觉、长记忆成本、安全护栏与合规

AI Agent的工作原理

AI Agent是一个有机循环过程,涉及五个关键阶段:

  • 输入处理,接受环境各种信息,文本、图像、音频
  • 理解与分析,读取信息,提取关键要素并进行推理。
  • 决策制定,基于以上分析,评估可能行动方案,选择最优解。
  • 行动执行,讲决策转为具体操作,涉及调用外部工具或与环境交互。
  • 反馈和学习,评估行动效果,通过各种学习机制不断优化自身能力。

AI Agent的4种设计模式

AI Agent的4种设计模式

1. 反思(Reflection)

定义:让AI像人类一样对自己的输出进行审视、评估并优化,从而提升质量和准确性。
机制

  • 生成初稿 → 自我评估(逻辑、完整性、风格) → 修改优化 → 多轮迭代
  • 高级形式如 Reflexion 会记录历史行为和反思日志,支持长期经验积累
    应用场景:写作、代码生成、问答系统、教育辅导等需要高质量输出的任务
    代表实现:基础 Reflection、Reflexion、LATS(Language Agent Tree Search)

2. 工具调用(Tool Use)

定义:赋予AI调用外部工具(如API、数据库、代码解释器)的能力,突破大模型“只懂语言”的局限。
机制

  • 模型识别任务需求 → 调用合适工具 → 获取外部信息或执行操作 → 综合结果
    常见工具类型
  • 信息类:搜索引擎、知识库、天气/股票接口
  • 计算类:Python解释器、数学引擎
  • 执行类:发送邮件、操作数据库、生成图表
    应用场景:金融分析、科研助手、自动化办公、智能客服

3. 规划(Planning)

定义:让AI具备“先想后做”的能力,将复杂目标拆解为可执行的步骤,并按计划推进。
机制

  • 目标输入 → 任务分解(子目标) → 策略生成(顺序、工具选择) → 执行与调整
  • 可结合强化学习或启发式算法优化路径选择
    应用场景:旅行规划、项目管理、研究设计、实验流程编排
    挑战:对模型推理能力要求高,需处理任务依赖、失败回滚等问题

4. 多智能体协作(Multi-Agent Collaboration)

定义:多个AI Agent扮演不同角色,通过分工协作、信息共享与观点碰撞,解决复杂任务。
机制

  • 角色分工:如策划者、写作者、评审者、执行者
  • 协作方式:对话讨论、投票决策、交叉验证
  • 系统架构:垂直(主控+子Agent)或水平(平等协作)
    应用场景:软件开发(如虚拟公司 ChatDev)、内容创作、团队决策模拟
    优势:提升任务质量、扩展性强、支持复杂流程
    挑战:协调复杂、调试困难、成本高

总结对比表:

模式 核心能力 适用任务类型 成熟度 关键挑战
反思 自我评估与优化 内容创作、问答 评估标准难统一
工具调用 外部能力扩展 数据分析、自动化 工具选择与错误处理
规划 任务拆解与执行 项目管理、复杂任务 步骤依赖与失败回滚
多智能体协作 分工协作与整合 跨领域任务、团队模拟 协调机制与一致性控制

这些模式并非互斥,实际系统中常组合使用。例如:一个多智能体系统中,每个Agent都可能具备反思能力、调用工具和规划子任务,从而实现更强大的“数字员工”能力。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐