MemCon:让 Agent 的记忆框架学会进化
一句话介绍
Agent 记忆框架在记忆表示上花里胡哨(原始轨迹、反思规则、技能、建图)但在记忆读写时通常都是一套固定的管线。MemCon 认为即使记忆内容不变,访问策略也应随任务、库存和历史反馈调整,把“要不要查、查什么、查多少”变成在线学习的决策,在不新增 LLM 调用的前提下,提升任务成功率、降低 token 消耗,并且能直接应用到任意现有记忆框架上
- 论文标题:Memory as a Controlled Process: Learned Adaptive Memory Management for LLM Agents
- 论文地址:https://arxiv.org/abs/2607.13591
- 作者背景:加州大学洛杉矶分校、华盛顿大学、西北大学
- 代码地址:https://github.com/ericjiang18/MemCon
一、动机
LLM Agent 的长期记忆已经有很多形态:向量检索、反思与规则、技能库、轨迹摘要、图结构记忆,但多数系统的访问方式仍是一条固定管道:每次都使用同一查询模板、同一个 top-k、同一图搜索深度,在相同的位置把检索结果塞回提示词
这套做法的问题不在于检索本身无效,而在于任务和记忆库的状态会持续变化
- 早期任务:记忆库刚建立,相关经验很少;强行检索只会把无关内容带进上下文
- 重复任务:相似目标反复出现时,复用一份抽象后的成功计划通常最有用
- 卡住状态:Agent 连续做重复动作时,重新读同一批
top-k记忆没有帮助 - 长任务流:记忆累积到一定规模后会出现噪声和重复,需要合并、压缩或遗忘
这些场景对记忆访问的要求相互冲突。一个固定的 top-k、固定查询或固定维护周期,必然会在部分状态下失配
记忆系统的能力不仅取决于库里有什么,还取决于此刻该不该取、该取哪一种、该取多少
已有工作 MemGPT 让 LLM 自己决定翻页、查询和回忆时机,解决了灵活性问题。但记忆操作是高频行为:每一次决策都额外请求一次 LLM,会带来时延和成本;同时,模型也不会把某次任务中 “哪种访问方式有效” 的经验显式累积成策略
对此作者设计了 MemCon(Memory as a Controlled Process),一个更轻量的控制器来解决上述问题
二、实现方案
MemCon 不是新的记忆存储后端,而是在现有记忆模块外包一层控制器,把每次记忆操作看作一个状态下的动作选择

2.1 状态
控制器的状态由两类特征组成。
-
任务侧特征:包括目标类型、当前步骤阶段、是否陷入重复动作、当前持有的对象与已经访问的位置。比如 Agent 连续两步输出同一个物理动作,就会触发
is_stuck标记 -
记忆侧特征:包括记忆条目数、当前目标是否已有可复用计划,以及策略处于冷启动还是已积累足够经验的阶段
这些连续或复杂信号会被离散化为紧凑的状态键。实测发现,每个基准只会形成数量级为数百的状态,因此没有采用重型深度强化学习,而是使用能快速在线收敛的表格策略
2.2 动作
在一个状态下,MemCon 可选择六类操作:
- Retrieve:按检索策略正常取回记忆;
- PlanInject:注入当前目标类型对应的通用成功计划;
- Re-Retrieve:更换查询 query 重新检索;
- Consolidate:调用后端的合并、整理等维护操作;
- Forget:调用后端的清理或淘汰操作;
- NoOp:跳过当前这次记忆访问
检索相关动作还带有 top_k、insight_k 和图搜索 hop 等参数。是否检索、检索什么、检索多少都不再由人工写死,而是成为策略可学习的动作空间
2.3 在线学习
Agent 完成一个任务后,环境只提供成功或失败这类稀疏反馈。MemCon 将任务成功、失败以及任务效率组合成终局奖励,再对本任务中访问过的状态—动作对做倒序折扣更新:越接近任务结局的决策获得越强的信用,越早的决策获得衰减后的信用
动作选择使用 UCB(Upper Confidence Bound)。未尝试过的动作优先探索;有足够历史数据后,再在经验回报与探索价值之间权衡。Q 值还会从可解释的先验开始热启动:常规检索和计划注入具有轻微正先验,遗忘和跳过检索具有轻微负先验,避免最初几次任务完全随机
把过去任务的成败压缩为一张可持续更新的决策表
2.4 兼容性
MemCon 最重要的工程选择是与存储后端解耦。它只假设底层记忆模块具有 retrieve 和 store 两个抽象入口;可选的维护接口则用于整理和遗忘。控制器拦截这些入口、决定调用方式,但不读取或修改后端的内部数据
因此,向量库、技能库、轨迹摘要、潜变量记忆和图记忆都可以沿用原本的存储逻辑,只在外面增加一层自适应访问策略
三、实验结果
作者在六类基准(交互决策、知识/网页/工具使用)上评估了 MemCon,覆盖 Lobster、LangGraph、Microsoft Agent-Framework 三种 Agent 框架,以及 GPT-4.1-mini、Claude Sonnet-4、DeepSeek-V3.2 三种底座模型,并与九类记忆基线比较。其中 GPT-4.1-mini 上的测试结果如下:

可见 MemCon 在 18 个框架 × 基准设置中取得 14 个第一,而在 Sonnet-4 和 DeepSeek-V3.2 上 均有 15 个第一
值得注意的是,收益并非来自把更多文本塞进提示词。Lobster—ALFWorld 上,MemCon 每任务平均使用 39K token,而最强固定基线为 45K token,减少约 13%。MemCon 在不同底座上都有 5%—20% 的 token 降幅

此外,作者还观察到一个趋势:底座模型越强,自适应访问越重要。以 Sonnet-4 为例,模型本身已经具备较强的执行能力,决定上限的往往不是 “能不能理解检索到的经验”,而是 “关键经验会不会在恰当时刻被提供”。这也是 MemCon 在该模型上更明显领先的原因
例如在网页任务中,Agent 连续重复动作后,is_stuck 状态被触发;策略从普通检索切换到 Re-Retrieve,用替代查询找到关键页面。任务成功后,这次切换会更新相应 Q 值,使未来相似卡住状态更倾向采取重检索动作
更多推荐




所有评论(0)