一个基于LLM的智能体Agent,是一个能够自主理解环境、进行规划决策、并执行行动以达成特定目标的系统。
核心特征是 利用一个大语言模型LLM 作为大脑或中央处理器,来进行复杂的推理和决策。

核心组件:

1、大脑/核心引擎(Brain/Core Engine):

  • 组件:一个强大的大语言模型LLM,如GPT系列、Gemini等
  • 作用:这是Agent的认知核心。
    负责理解用户目标、感知环境信息、进行常识推理、制定计划、并决定下一步的行动
    所有其他组件的输出都会汇集到LLM进行处理。

2、规划模块(Planning Module):

  • 组件: 可以是LLM的内置能力(通过CoT、ReAct等提示策略触发),也可以是独立的算法模块。
  • 作用: 负责将一个复杂、长期的目标分解成一系列更小、更具体的、可执行的子任务
    它还负责根据行动的反馈 动态调整修正计划。
    规划能力是Agent处理复杂任务的关键。

3、记忆模块(Memory Module):

  • 组件: 通常是外部数据库和数据结构的组合,如向量数据库、键值存储等。
  • 作用:
    • 短期记忆:记录当前的对话历史、中间步骤的思考过程,用于维持任务的连贯性。
    • 长期记忆:存储过去的经验、知识、用户偏好,通过检索(通常是RAG) 来为当前决策提供信息。

4、工具使用模块(Tool Use Module):

  • 组件: 一系列外部API、函数库或硬件接口。
  • 作用: 扩展Agent的能力边界。LLM本身无法获取实时信息、执行数学计算或与物理世界交互。
    工具使用模块 允许Agent调用外部工具来完成这些任务,如:
  • 信息获取:调用搜索引擎、数据库查询API
  • 代码执行: 运行Python解释器、访问终端
  • 物理操作: 调用智能家居API
Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐