MRAgent:把长期记忆从被动检索改成主动重构
长期交互中的 agent 记忆问题,表面上是上下文窗口不够长,实际更接近一个检索策略问题。用户问的问题往往不会直接命中某条历史记录,而是需要先找到一个线索,再从这个线索推到时间、人物、主题或另一个事件。传统记忆系统通常先按 query 做一次 top-k 检索,再把结果交给模型推理;如果第一轮检索没有拿到关键证据,后面的推理很难补救。
论文《Memory is Reconstructed, Not Retrieved: Graph Memory for LLM Agents》提出的 MRAgent 针对的就是这个断点。它把 agent 记忆访问从 retrieve-then-reason 改成边检索边推理的 active reconstruction:模型在检索过程中根据已发现证据调整下一步搜索方向,而不是一次性决定全部记忆上下文。
被动检索为什么不够
RAG、Mem0、LangMem 这类系统通常把记忆看作可搜索文本或摘要集合。查询来时,系统根据相似度取回若干条最相关内容。图记忆系统更进一步,会从相似节点出发扩展邻居,利用实体和关系结构找更多证据。
这些方法改善了记忆的组织方式,但检索策略仍然偏静态。相似度检索容易被表面词吸引;固定邻居扩展会带来噪声;图结构如果没有把真正需要的中间线索连上,检索就会停在错误区域。

图 1:被动检索只能围绕原始查询扩展,主动重构可以从中间证据推导新线索,再继续访问记忆。
论文中的例子是一个多会话问题:查询表面上提到 Nate 的游戏锦标赛,但正确答案还需要关联到 Caroline 在某个时间点的活动。被动检索会反复取回和游戏锦标赛相似的记录,图邻居扩展也可能带入无关节点;主动重构则能从已检索内容中推断出 July 这样的时间线索,再用新线索定位 Caroline 的相关事件。
这说明长期记忆不是简单读出存储内容。对 agent 来说,记忆访问本身也应该是一个推理过程:每一步证据都会改变下一步该查什么。
Cue-Tag-Content 记忆图
MRAgent 的存储结构叫 Cue-Tag-Content。Cue 是细粒度线索,例如人物、地点、属性或动作;Content 是具体记忆内容,包括 episodic memory 和 semantic memory;Tag 则是二者之间的关联标签,用来表达某个 cue 通过什么语义关系连接到某段内容。
Tag 的作用是把完整内容检索拆成两步。系统先从 cue 激活候选 tags,让模型判断哪些关联方向值得继续探索;只有方向被选中后,才取回具体 content。这样可以避免一上来展开大量完整事件,也让模型在访问昂贵记忆内容前先做轻量筛选。

图 2:MRAgent 先从对话构建 Cue-Tag-Content 关联图,查询时由 LLM 在 cues、tags 和 contents 之间多步遍历。
论文把记忆内容分成三层。
- Episodic layer 保存具体事件,并保留时间线信息,适合回答发生了什么、什么时候发生、谁参与了某个事件。
- Semantic layer 保存相对稳定的事实和属性,例如人物偏好、背景信息和长期特征。
- Topic layer 把一组相关事件抽象成主题,支持先定位高层主题,再下钻到具体 episode。
这种多粒度设计的重点不在于把所有关系提前建得很复杂,而是提供一组可控入口,让模型能按任务需要在事件、语义事实和主题之间切换。
检索过程变成多步行动
MRAgent 在查询时维护一个 reconstruction state,包含当前活跃的记忆元素和已经积累的证据。每一轮中,LLM 根据原始问题、已有证据和当前候选节点,选择下一步 traversal actions,例如从 cue 找 tag、从 cue-tag 取 content,或从已取回 content 反向激活新的 cue 和 tag。
这个过程有三步。
- LLM reasoning:模型判断当前证据还缺什么,并选择最有希望的信息方向。
- Controlled traversal:记忆系统执行对应图操作,生成下一批候选节点。
- LLM routing:模型从候选节点中保留相关证据,剪掉噪声分支,并判断是否可以回答。
相比固定 top-k,这种设计把检索预算用在 query-specific 的路径上。复杂问题可以多走几步;简单问题可以较早停止。论文也给出理论分析,说明在相同检索预算下,主动检索策略的表达能力严格强于一次性决定全部检索节点的被动策略。
实验:提升主要来自结构和多步推理的组合
论文在 LoCoMo 和 LONG-MEMEVAL 上测试 MRAgent。LoCoMo 关注长对话记忆,问题类型包括 single-hop、multi-hop、temporal 和 open-domain;LONG-MEMEVAL 用来评估跨多个会话的长期交互记忆。基线包括 RAG、LangMem、A-Mem、MemoryOS 和 Mem0,后端模型使用 Gemini-2.5-Flash 与 Claude-Sonnet-4.5。
主结果显示,MRAgent 在 LoCoMo 上明显优于这些记忆系统。Gemini 后端下,overall LLM-Judge 从 Mem0 的 68.31 提升到 84.21;Claude 后端下,overall 从 LangMem 的 78.61 提升到 88.32。LONG-MEMEVAL 上,MRAgent 的 overall LLM-Judge 为 72.95,高于最强基线的 54.92;如果使用 Claude 做检索、Gemini 构建记忆,MRAgent* 达到 86.76。
成本部分也值得注意。LONG-MEMEVAL 的 per-sample 统计中,MRAgent token consumption 为 118k,低于 Mem0 的 245k、MemoryOS 的 273k、A-Mem 的 632k 和 LangMem 的 3268k。它的运行时间 586.11 秒接近 Mem0 的 533.29 秒,同时明显快于 A-Mem、LangMem 和 MemoryOS。

图 3:从 CE 到 CTE 再到 CTC,记忆结构越完整效果越好;加入多步推理后,性能进一步提升。
消融结果说明,收益不是单靠图结构或单靠 LLM 推理得到的。Cue-Tag-Episode 比直接 Cue-Episode 更好,完整 Cue-Tag-Content 进一步提升;在这些结构上加入 reasoning 后,multi-hop 问题的 Recall 和 LLM-Judge 都继续上升。去掉 semantic memory 也会带来明显下降,说明长期记忆中稳定事实和具体事件需要共同参与推理。
多轮重构怎样发挥作用
MRAgent 的多轮检索不是简单增加并行取回数量。论文分析了不同问题类型的 evidence recall 随 reasoning turns 的变化:single-hop 和 temporal 问题大约三轮内接近饱和,multi-hop 问题则随着连续探索显著提升,累计 recall 跨轮增长超过 30%。

图 4:多轮重构让复杂问题逐步找回缺失证据,尤其对 multi-hop 查询更关键。
这部分结果解释了为什么只提高 top-k 或扩大邻居扩展范围并不能等价替代主动重构。复杂长期记忆问题需要先看到部分证据,才能知道下一步应当往哪个方向找。并行扩大检索预算会带来更多候选,但不一定产生正确的新线索。
边界与启示
MRAgent 的代价是把一部分复杂度放到了检索阶段。单轮相似度检索延迟低、流程简单;MRAgent 对复杂问题需要多步 traversal 和多次 LLM 判断,因此深层查询会带来更高延迟。论文也指出,当前实现采用相对静态的记忆构建方式,没有处理长期运行中的更新、压缩和遗忘问题,记忆图会随着交互持续增长。
不过,这个设计给 agent 长期记忆提供了一个清晰方向:记忆系统不只是在上下文窗口外放一个可搜索数据库,还要把访问过程暴露给模型,让模型能根据中间证据改写检索目标。对个人助理、决策支持和长期任务 agent 来说,这类主动重构机制比一次性召回更接近真实使用场景。
总结
MRAgent 的核心观点是,长期记忆应当被重构,而不只是被检索。它用 Cue-Tag-Content 图把线索、关联和内容分开,让 LLM 在多轮检索中先选方向、再取内容、再根据新证据继续探索。
从实验看,这种结构化记忆加主动重构的组合,在 LoCoMo 和 LONG-MEMEVAL 上同时改善了准确性与 token 使用效率。它的局限也很明确:检索阶段更复杂,长期部署还需要记忆维护机制。但对需要跨会话、跨事件、跨时间线推理的 agent 来说,MRAgent 把记忆访问从静态上下文拼接推进到可控的多步推理过程。
学AI大模型的正确顺序,千万不要搞错了
🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!
有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!
就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇
学习路线:
✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经
以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!
我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~
这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

更多推荐
所有评论(0)