摘要

Agent 记忆系统的核心,不是“要不要向量库”,也不是“该不该上知识图谱”。

它的主矛盾是:

持续生长的历史状态,和有限、脆弱的临场上下文之间的矛盾。

一边是越来越长的交互轨迹、工具结果、用户偏好、网页状态、代码变更和反思记录。另一边是模型一次推理能稳定使用的上下文。窗口可以变长,注意力却不会自动变准。历史越厚,噪声越重;召回越多,干扰越大。

所以,记忆系统不是存储系统的别名。它更接近一套上下文调度机制:

公式读法:记忆不是把历史全收起来,而是按任务、模型和预算挑一份可用材料。

它要在具体任务、具体模型、具体预算下,把过去变成眼下可用的证据。

目录

1.主矛盾:历史增长 vs 临场上下文

2.形式化:记忆系统到底优化什么

3.六个关口:每一环都有主次

4.三类功能:事实、经验、工作

5.方法地图:论文各抓一头

6.设计原则:以场景作总裁判

一、主矛盾:历史增长 vs 临场上下文

设 Agent 的历史为 H,当前任务为 q,模型为 M,上下文预算为 B。记忆系统要做的,不是把 H 原样塞进 M,而是从 H 中构造一份可用上下文 C。

公式读法:C 是最后递给模型的那包材料。R 表示整套记忆机制。

其中 R 不是简单检索。它至少包含抽取、管理、存储、检索、注入几步。

目标也不是“召回越多越好”。更准确的写法应是:

公式读法:系统要让任务收益尽量高,同时守住三个约束:别超窗口,别带太多噪声,别歪曲历史。

U 表示任务效用。B 是上下文预算。Noise 是噪声。Faith 是对历史的保真。

这几个量彼此牵制。召回多了,Faith 可能升,Noise 也会升。压缩狠了,B 省下来,Faith 又会掉。把记忆写成结构化事实,检索会快;细节、语气、证据链又可能断。

这便是总矛盾。

历史要求完整,推理要求择要。

《Memory in the LLM Era》把记忆系统拆为抽取、管理、存储、检索,并在 LOCOMO 与 LONGMEMEVAL 上复现十种代表方法。一个重要结论是:没有一种方法通吃。长上下文拉大后,不少方法还会掉分。问题不只是找不到,而是找来之后压不住噪声。

《Memory in the Age of AI Agents》则从形式、功能、动态三轴重看 Agent Memory。形式问记忆以什么承载;功能问记忆服务什么任务;动态问记忆如何产生、更新、保留、淘汰和取用。两篇合在一起看,一纵一横:前者给流水线,后者给坐标系。

二、形式化:记忆系统到底优化什么

把记忆系统写成一个四元组:

公式读法:这不是要造新名词,只是把系统边界框出来:抽、管、存、注入,缺一块都不像完整记忆系统。

E 是 extraction,负责从轨迹中抽出候选记忆。

G 是 governance,负责更新、合并、遗忘、冲突处理。

S 是 storage,负责把记忆放成文本、向量、图、树、参数或混合形态。

I 是 injection,负责把检索结果组织成模型可吃的上下文。

一个成熟的 Agent 记忆系统,真正优化的是这条链:

History → E → G → S → Retrieve → I → Context → Action

工程上常犯的错,是把 S 当成 M_sys。

向量库只是 S 的一种。知识图谱也是 S 的一种。它们能解决一部分矛盾,不能替代整套调度。

若只谈存储,就会把主矛盾看偏。

三、六个关口:每一环都有主次

Agent 记忆系统的六个关口

总矛盾往下分,落成六个关口。每个关口都有自己的主矛盾。

关口 主矛盾 典型取舍
来源 未来效用 vs 输入洪水 什么该进记忆,什么只留在日志
抽取 保真 vs 可操作 原文、摘要、事实、事件、规则怎样取舍
管理 更新 vs 证据保留 新事实覆盖旧事实,还是版本并存
形态 可解释 vs 可扩展 文本、向量、图、树、参数各担哪一段
检索 相似 vs 有用 语义近,不等于对任务有用
注入 足量 vs 干扰 给少了缺证据,给多了乱推理

1. 来源:不是进得越多越好

Agent 的输入源很多。用户消息、系统提示、工具返回、网页 DOM、GUI 截图、终端日志、代码 diff、测试结果、PR 评论、多 Agent 对话,都能变成候选记忆。

来源关口的主矛盾是未来效用。

公式读法:这是一条入账规则。信息 x 的未来收益若大过保存和使用成本,就值得留下。

这解释了为什么个性化 Agent 重视用户偏好,编程 Agent 重视错误轨迹,网页 Agent 重视状态变化,多 Agent 系统重视责任链。来源不同,不是风格不同,是场景效用不同。

2. 抽取:不是越短越好

抽取要把轨迹变成记忆单元。可以是原文片段,可以是摘要,可以是三元组,可以是事件,可以是规则。

它的主矛盾是保真与可操作。

公式读法:抽取后的记忆 m 要同时看三项:像不像原历史,有没有用,长不长。

MemoryBank 把长对话炼成用户画像,并用遗忘曲线调权重。MemoChat 让模型先写 memo,再据 memo 回答。Mem0 抽取可检索的长期事实。它们都在回答同一件事:怎样把旧轨迹压成未来可用的条目。

3. 管理:不是新事实直接覆盖旧事实

长期记忆一旦进入现实场景,马上遇到冲突。

用户昨天说爱喝咖啡,今天说胃不舒服。代码仓库昨天测试失败,今天补丁已修。网页状态刚才存在,刷新后消失。

管理关口的主矛盾是更新与证据保留。

公式读法:这里分两层。当前状态要随新事件更新,原始轨迹也要留下,便于追溯和回滚。

Zep / Graphiti 把事实放进时间知识图谱,让边带时间和版本。A-MEM 把新记忆写成卡片,再反向更新旧卡。Memory-R1 训练 ADD、UPDATE、DELETE、NOOP。它们都不是单纯“记住”,而是在治理记忆。

4. 形态:不是向量和图二选一

记忆形态可以分成明文、向量、图、树、参数、隐状态。

明文好审计,向量好召回,图擅长关系,树擅长层级,参数适合内化,隐状态适合短程工作。

形态关口的主矛盾是可解释与可扩展。

公式读法:这不是数学定理,而是选型准则。R 可以是文本、向量、图、树,也可以是混合结构。选哪一种,要看三笔账:成本、收益、风险。

成本包括写入、检索、维护和 token。收益包括召回、推理、解释和复用。风险包括幻觉、过期、泄漏、难审计。所谓“向量库还是知识图谱”,其实只是这条式子下面的一个分支。

MemGPT 把上下文当内存,把外部库当磁盘,让模型调页。MemoryOS 分短期、中期、长期。MemOS 用 MemCube 管内容、来源、版本和生命周期。MemTree 用树来容纳局部细节与上层摘要。它们是在重写“记忆以什么形态存在”。

5. 检索:相似不是有用

向量检索常把“语义接近”当成“任务相关”。这在短问答里尚可,在长程 Agent 里很容易失手。

检索关口的主矛盾是相似与有用。

公式读法:检索分数不能只看 sim。还要加任务收益,扣掉噪声。

真正有效的检索,往往要混合语义相似、时间新鲜度、实体关系、任务阶段、用户目标和失败经验。图结构记忆、时间图谱、树状记忆、反思记忆,本质上都是在给检索加坐标。

6. 注入:给够,也要不扰乱

检索之后,还要注入。注入不是把结果贴上去。

它要决定顺序、格式、粒度、位置和语气。放在 system、developer、user、tool result 前后,效果并不一样。模型对 prompt 的感知也不一样。

注入关口的主矛盾是足量与干扰。

公式读法:注入要找一个格式 I。它能帮模型完成任务,又不把模型带偏。

ACON 做上下文压缩,MemAgent 用固定长度记忆跨段读文档,长上下文评测不断显示:窗口大,不等于注入好。上下文工程把 memory 纳入 context engineering,正是看到这一点。

四、三类功能:事实、经验、工作

若按功能分,Agent 记忆至少有三类。

第一类是事实记忆。它回答“世界和用户现在是什么样”。用户偏好、身份、约束、承诺、实体关系都在这里。它的主矛盾是稳定与更新。

第二类是经验记忆。它回答“过去怎么做成,怎么做坏”。失败轨迹、调试经验、反思策略、工具使用套路都在这里。它的主矛盾是泛化与误导。

第三类是工作记忆。它回答“眼下这件事走到哪一步”。计划、待办、临时变量、当前页面、当前文件、当前推理状态都在这里。它的主矛盾是短暂与连贯。

三者不能混放。

公式读法:这里说的是功能分层,不是简单相加。三类记忆可以共存,但治理规则要分开。

事实记忆要审计,经验记忆要抽象,工作记忆要快进快出。混在一起,检索会乱,注入会脏,更新也会失手。

五、方法地图:论文各抓一头

Agent 记忆论文的方法地图

把方法放回主次矛盾里看,脉络会清楚许多。

方法族 抓住的关口 代表方法 核心动作
事实与偏好 来源、抽取、更新 MemoryBank, MemoChat, Mem0 把对话炼成用户事实和可取 memo
管理与调度 管理、注入 MemGPT, MemoryOS, MemOS 把记忆当系统资源调度
关系与演化 形态、检索、更新 Zep, Graph Memory, A-MEM 用图、卡片、时间边组织关系
经验与反思 抽取、泛化 ExpeL, ReasoningBank 从成败轨迹中炼策略
压缩与注入 检索、注入 ACON, MemAgent, Memory-R1 学会压缩、重写、写入和删除

这张表说明一件事:

没有通吃方法,只有场景里的主矛盾。

长对话个性化,事实与偏好居先。软件工程,多轮工具轨迹和失败经验居先。网页 Agent,状态变化和环境可观测性居先。多 Agent,通信记录、责任边界和共享黑板居先。

方法不同,常不是优劣不同,而是主矛盾不同。

六、设计原则:以场景作总裁判

设计 Agent 记忆系统,不宜从组件清单开始。应先问四个问题。

第一,任务失败主要败在哪里?

是忘了用户偏好,是丢了工具结果,是找错旧证据,是上下文太吵,还是模型读不懂注入格式?

第二,哪类历史有未来效用?

不是所有日志都值得升格成记忆。能改变未来动作的,才有资格入账。

第三,记忆的证据链要不要保留?

医疗、法律、金融、代码审查,不能只留摘要。闲聊、推荐、轻量个性化,可以更重压缩。

第四,模型怎样感知 prompt?

同一条记忆,写成表格、JSON、自然语言、项目符号,放在不同位置,效果都可能变。模型变,prompt 感知也变。

一个可执行的设计式如下:

For each scenario s:  find bottleneck b_s  choose memory form R_s  choose update rule G_s  choose retrieval rule K_s  choose injection format I_s  evaluate on task outcome

这里的关键不在“选最先进方法”,而在“找准瓶颈”。

结语

Agent 记忆系统的主要矛盾,不是存储容量不够。

它是历史无限生长,临场上下文有限;世界持续变化,模型一次只能择要推理。

围绕这条主线,来源、抽取、管理、形态、检索、注入各有次级矛盾。再按功能横切,又分事实记忆、经验记忆、工作记忆。论文方法的差别,正是这些矛盾在不同场景中的投影。

最后仍要落到实践。

分类只能给坐标。公式只能给约束。真正的裁判,是任务结果。

记忆有没有用,不看名字响不响。看它是否少犯旧错,是否省 token,是否稳住长程任务,是否经得住模型和 prompt 的变动。

能经得住,才算记住。

学AI大模型的正确顺序,千万不要搞错了

🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!

有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!

就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

在这里插入图片描述

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇

学习路线:

✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经

以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!

我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费

在这里插入图片描述

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐