文章目录


前言

前面已经阅读了 A-Mem、Memory-R1、LightMem、AgeMem、GAM、Mem0 和 Zep 等多种 Agent 记忆方法。

这些方法分别关注:

  • 如何提取和更新长期记忆;
  • 如何建立记忆之间的结构化关联;
  • 如何统一管理短期记忆和长期记忆;
  • 如何降低记忆系统的 token 和调用成本;
  • 如何用知识图谱保存实体、关系和时间变化。

但是,它们大多仍然面临一个共同问题:

召回到的记忆虽然在语义上相关,却不一定真的能够帮助 Agent 完成当前任务。

传统 RAG 和多数记忆系统通常默认:

语义越相似
→ 越值得召回
→ 越有助于完成任务

但在实际 Agent 任务中,这个假设并不总是成立。

例如,Agent 当前需要完成一个文件操作任务:

把目录中的所有 Markdown 文件移动到 archive 文件夹。

记忆库中可能存在两条语义相近的历史经验:

经验 A:
先使用 ls 查看目录,再逐个调用 mv 移动文件。
历史上多次成功。

经验 B:
直接执行 mv *.md archive。
在目标文件夹不存在时执行失败。

两条经验都与“移动 Markdown 文件”高度相关。但如果只根据向量相似度召回,它们的排名可能非常接近。

真正重要的问题不是:

哪条经验与当前任务在语义上更相似?

而是:

哪条经验在过去真正帮助 Agent 完成了任务?

这篇论文提出了 MemRL,一种基于情景记忆的非参数强化学习方法。

MemRL 不修改大模型权重,而是把学习过程放在外部记忆中。每条经验除了保存对应的任务意图和解决过程,还会保存一个可持续更新的效用值,也就是 Q 值。

当 Agent 使用某条记忆完成任务后,系统根据环境反馈更新该记忆的效用:

使用某条经验后任务成功
→ 提高这条经验的效用值

使用某条经验后任务失败
→ 降低这条经验的效用值

下一次面对相似任务时,系统不仅考虑语义相似度,还会优先选择历史上真正有效的经验。

因此,MemRL 的核心思路可以概括为:

不更新模型参数,而是通过环境奖励持续学习“哪些记忆真正有用”。

这种方法试图在两个目标之间取得平衡:

  • 稳定性:冻结大模型参数,避免在线微调造成灾难性遗忘;
  • 可塑性:通过持续更新外部记忆的效用,让 Agent 在运行过程中不断进步。

零、论文基本信息

  • 论文名称MemRL: Self-Evolving Agents via Runtime Reinforcement Learning on Episodic Memory
  • 发表平台:arXiv preprint
  • 代码仓库MemTensor/MemRL
  • 作者信息
    • Shengtao Zhang,Shanghai Jiao Tong University
    • Jiaqian Wang,Xidian University
    • Ruiwen Zhou,National University of Singapore
    • Junwei Liao,Shanghai Jiao Tong University / Shanghai Innovation Institute
    • Yuchen Feng,MemTensor
    • Zhuo Li,Shanghai Jiao Tong University
    • Yujie Zheng,Shanghai Jiao Tong University
    • Weinan Zhang,Shanghai Jiao Tong University / Shanghai Innovation Institute
    • Ying Wen,Shanghai Jiao Tong University / Shanghai Innovation Institute
    • Zhiyu Li,MemTensor
    • Feiyu Xiong,MemTensor
    • Yutao Qi,Xidian University
    • Bo Tang,University of Science and Technology of China / MemTensor
    • Muning Wen,Shanghai Jiao Tong University

一、这篇论文想解决什么问题?

这篇论文关注的是:

如何让已经部署的 Agent 在不更新模型参数的情况下,持续从过去的任务经验和环境反馈中学习?

当前让 Agent 获得持续学习能力,主要有两条路线。

1. 参数化学习

参数化学习会通过微调、强化学习或在线更新模型参数,把新经验写入模型权重。

这种方法的优点是,新能力能够直接内化到模型中。

但是,它也存在明显问题:

  • 训练成本较高;
  • 需要保存梯度和优化器状态;
  • 在线更新速度较慢;
  • 新任务训练可能破坏旧能力;
  • 容易出现灾难性遗忘;
  • 在生产环境中很难频繁更新大模型。

也就是说,参数更新具有较强的可塑性,但可能破坏模型原本的稳定性。

2. 非参数记忆学习

另一条路线是保持模型参数不变,把新经验存入外部记忆。

当 Agent 再次遇到相似问题时,从记忆库中检索过去的解决方案,并将其作为上下文提供给模型。

这种方法:

  • 不需要训练模型;
  • 写入速度快;
  • 容易增量扩展;
  • 不会直接破坏模型原有能力。

但是,现有方法通常只根据语义相似度召回经验。

这会带来一个关键问题:

语义相似的经验不一定具有相同的任务效用。

例如:

当前任务:
查找数据库中销量最高的商品。

经验 A:
使用 ORDER BY sales DESC LIMIT 1。
历史执行成功。

经验 B:
使用 MAX(sales),但没有返回对应商品名称。
历史执行失败。

经验 A 和经验 B 在语义上都高度相关,但它们对完成当前任务的帮助不同。

如果系统无法记录环境反馈,就可能反复召回失败经验。

3. 稳定性与可塑性的矛盾

论文把这一问题概括为稳定性—可塑性困境:

只保持模型不变:
系统稳定,但缺乏持续学习能力。

持续修改模型参数:
系统可以学习,但可能遗忘旧能力。

MemRL 的解决思路是:

冻结大模型
+
持续更新外部情景记忆

模型负责稳定推理,记忆负责运行时学习。

论文 Figure 1 展示了这种类比关系。

MemRL概念框架

图源:Zhang et al., 2026,Figure 1。

图中将冻结的大模型类比为相对稳定的认知推理系统,将外部情景记忆类比为能够持续变化的经验系统。

环境反馈不会修改模型权重,而是用于更新记忆的效用值,从而让学习发生在记忆空间中。


二、相关工作

论文的相关工作主要涉及三个方向:

  1. 运行时学习;
  2. 大模型强化学习;
  3. Agent 记忆系统。

1. 运行时学习

运行时学习关注 Agent 在部署之后,如何通过持续交互不断提高能力。

它与传统持续学习和测试时适应有所不同。

传统持续学习通常仍然会更新模型参数,以适应不断变化的数据分布;测试时适应也经常通过调整部分参数,使模型适应当前测试环境。

而 MemRL 设置了一个更严格的约束:

大模型主干必须保持冻结。

这意味着 Agent 的能力提升不能来自模型参数,而只能来自外部经验记忆和检索策略的变化。

2. 大模型强化学习

强化学习已经广泛应用于大模型训练,例如:

  • 基于人类反馈的强化学习;
  • 使用规则验证器优化推理;
  • 通过环境奖励训练工具调用;
  • 让 Agent 学习复杂动作策略。

这些方法的共同特点是:

环境奖励
→ 优化模型参数或额外的参数化策略模块

MemRL 同样利用环境奖励,但优化对象发生了变化:

传统强化学习:
更新模型参数。

MemRL:
更新记忆中的效用值和检索策略。

因此,论文把它称为 Non-Parametric Reinforcement Learning,非参数强化学习

这里的“非参数”不是指系统完全没有参数,而是指:

运行时学习过程不修改大模型权重,学习结果保存在外部记忆结构中。

3. Agent 记忆系统

早期记忆系统主要使用:

  • 向量数据库;
  • 语义相似度检索;
  • 对话摘要;
  • 分层存储;
  • 固定启发式规则。

后续方法开始关注:

  • 记忆的提取和更新;
  • 记忆节点之间的结构化关联;
  • 记忆反思;
  • 基于反馈的记忆优化;
  • 长期记忆生命周期管理。

但论文认为,大多数现有方法仍然缺少一个明确指标:

一条记忆在被召回后,究竟多大概率能够帮助 Agent 获得更高任务奖励?

MemRL 通过 Q 值显式建模这种功能效用,把记忆召回从相似度匹配转化为价值决策。


三、问题组织:记忆增强的 Agent 策略

论文使用 Memory-Based Markov Decision Process,基于记忆的马尔可夫决策过程 描述 Agent 与记忆之间的交互。

该过程可以表示为:

( S , A , P , R , γ , M ) \left(S,A,P,R,\gamma,M\right) (S,A,P,R,γ,M)

其中:

  • S S S 表示状态空间;
  • A A A 表示 Agent 的动作空间;
  • P P P 表示环境状态转移;
  • R R R 表示奖励函数;
  • γ \gamma γ 表示折扣因子;
  • M M M 表示不断演化的外部记忆库。

在第 t t t 个时间步,Agent 接收当前状态 s t s_t st,从记忆库 M t M_t Mt 中选择相关经验,再生成动作 a t a_t at

整个 Agent 策略可以写成:

π ( a t ∣ s t , M t ) = ∑ m ∈ M t μ ( m ∣ s t , M t ) p L L M ( a t ∣ s t , m ) \pi(a_t\mid s_t,M_t)=\sum_{m\in M_t}\mu(m\mid s_t,M_t)p_{\mathrm{LLM}}(a_t\mid s_t,m) π(atst,Mt)=mMtμ(mst,Mt)pLLM(atst,m)

其中:

  • μ ( m ∣ s t , M t ) \mu(m\mid s_t,M_t) μ(mst,Mt) 是记忆检索策略;
  • p L L M ( a t ∣ s t , m ) p_{\mathrm{LLM}}(a_t\mid s_t,m) pLLM(atst,m) 是冻结大模型的推理策略;
  • m m m 是被召回的某条记忆;
  • π \pi π 是最终的联合 Agent 策略。

这个公式可以理解为:

最终动作质量
=
记忆检索策略
+
冻结大模型根据该记忆生成动作的能力

过去的记忆增强方法主要优化第二部分,也就是换更强的生成模型,或者只用固定的向量相似度作为第一部分。

MemRL 则重点优化:

μ(m | s, M)

也就是:

当前状态下,究竟应该选择哪条历史记忆?

论文 Figure 2 给出了一个跨任务经验复用的例子。

跨经验复用例子

图源:Zhang et al., 2026,Figure 2。

在时间步 t + 1 t+1 t+1,Intent B 产生了一条成功经验并被写入记忆。到了时间步 t + 2 t+2 t+2,另一个任务 Intent A 可以召回这条经验,并利用其中可迁移的策略获得成功。

这说明情景经验不一定只服务于原始任务,也可能被语义相近的其他任务复用。


四、非参数强化学习

传统记忆召回通常根据余弦相似度选择记忆:

当前问题与历史经验越相似
→ 排名越靠前

MemRL 则将记忆召回视为一个价值决策问题。

1. 状态、动作和效用的重新映射

在 MemRL 中:

强化学习概念 MemRL 中的含义
状态 s s s 当前用户意图或任务查询
动作 m m m 从记忆库中选择某条经验
奖励 r r r 使用经验后环境返回的任务结果
Q 值 Q ( s , m ) Q(s,m) Q(s,m) 在意图 s s s 下使用记忆 m m m 的预期效用

这里需要注意,强化学习中的“动作”并不是 Agent 最终执行的环境动作,而是:

检索阶段选择哪条记忆。

Agent 的最终工具调用或自然语言输出,仍然由冻结的大模型生成。

2. 最优检索策略

MemRL 希望选择预期效用最高的记忆:

μ ∗ ( m ∣ s , M ) = arg ⁡ max ⁡ m ∈ M Q ( s , m ) \mu^{*}(m\mid s,M)=\arg\max_{m\in M}Q(s,m) μ(ms,M)=argmMmaxQ(s,m)

其中:

  • Q ( s , m ) Q(s,m) Q(s,m) 表示在当前意图 s s s 下,使用记忆 m m m 所能获得的预期回报;
  • μ ∗ \mu^{*} μ 表示最优记忆检索策略。

这个公式的直观含义是:

不只检索“看起来相似”的记忆,而要选择“过去真正有效”的记忆。


五、MemRL 方法总览

MemRL 的整体框架如 Figure 3 所示。

MemRL方法架构图

图源:Zhang et al., 2026,Figure 3。

整个运行时学习闭环可以概括为:

接收当前任务
→ 从记忆库召回语义相关候选
→ 根据相似度和 Q 值进行价值感知选择
→ 将选中的经验加入上下文
→ 冻结的大模型生成解决方案
→ 在环境中执行
→ 获得奖励
→ 更新被使用记忆的 Q 值
→ 总结本轮经验并写回记忆库

框架包含三个核心模块:

  1. Intent-Experience-Utility 三元组记忆
  2. Two-Phase Retrieval 两阶段召回
  3. Runtime Utility Update 运行时效用更新

六、意图—经验—效用三元组

传统记忆库可能只保存:

查询 → 回答

或者:

记忆文本 → embedding

MemRL 将每条记忆组织为:

M = { ( z i , e i , Q i ) } i = 1 ∣ M ∣ M=\left\{\left(z_i,e_i,Q_i\right)\right\}_{i=1}^{|M|} M={(zi,ei,Qi)}i=1M

其中:

  • z i z_i zi 表示 Intent,即原任务的意图;
  • e i e_i ei 表示 Experience,即解决任务的经验;
  • Q i Q_i Qi 表示 Utility,即该经验学习到的效用值。

1. Intent:意图

Intent 描述这条经验最初解决的任务。

例如:

查找数据库中销售额最高的商品。

系统会对 Intent 进行向量化,用于第一阶段的语义召回。

2. Experience:经验

Experience 保存任务执行轨迹的总结。

它可能包括:

  • 使用过的工具;
  • 关键操作步骤;
  • 成功策略;
  • 失败原因;
  • 代码模板;
  • 环境约束;
  • 需要避免的错误。

例如:

先查询商品表结构,确认销售额字段名称;
使用 ORDER BY revenue DESC LIMIT 1;
不要只查询 MAX(revenue),否则无法返回商品信息。

相比保存完整轨迹,经验摘要更加紧凑,也更容易迁移到相似任务。

3. Utility:效用

Utility 使用 Q 值表示。

它近似估计:

将经验 e i e_i ei 应用于与意图 z i z_i zi 相似的任务时,能够获得多高的预期回报?

如果一条经验多次帮助 Agent 完成任务,它的 Q 值会逐渐提高。

如果一条经验经常导致失败,它的 Q 值会降低。

因此,记忆不再只是“存在或不存在”,而是具备了一个可以持续学习的价值信号。


七、从语义召回到价值感知选择

MemRL 的检索分成两个阶段:

  1. 语义候选召回;
  2. 价值感知选择。

1. 第一阶段:基于相似度的候选召回

对于当前查询 s s s,系统首先根据 Intent embedding 召回语义相似的候选经验。

候选集合可以写为:

C ( s ) = TopK ⁡ k 1 ( { i ∣ sim ⁡ ( Emb ⁡ ( s ) , Emb ⁡ ( z i ) ) > δ } ) C(s)=\operatorname{TopK}_{k_1}\left(\left\{i\mid\operatorname{sim}\left(\operatorname{Emb}(s),\operatorname{Emb}(z_i)\right)>\delta\right\}\right) C(s)=TopKk1({isim(Emb(s),Emb(zi))>δ})

其中:

  • Emb ⁡ \operatorname{Emb} Emb 表示 embedding 模型;
  • sim ⁡ \operatorname{sim} sim 表示余弦相似度;
  • δ \delta δ 是相似度阈值;
  • k 1 k_1 k1 是第一阶段召回数量;
  • C ( s ) C(s) C(s) 是语义相关的候选记忆集合。

这一阶段解决的是:

哪些历史经验和当前任务大致相关?

如果没有候选记忆超过阈值,系统不会强行使用低相关经验,而是让冻结大模型独立探索。

这一点很重要,因为错误记忆有时比没有记忆更危险。

2. 第二阶段:价值感知选择

从候选集合中,MemRL 使用相似度和 Q 值共同计算最终得分:

score ⁡ ( s , z i , e i ) = ( 1 − λ ) sim ⁡ ^ ( s , z i ) + λ Q i ^ \operatorname{score}(s,z_i,e_i)=(1-\lambda)\widehat{\operatorname{sim}}(s,z_i)+\lambda\widehat{Q_i} score(s,zi,ei)=(1λ)sim (s,zi)+λQi

其中:

  • sim ⁡ ^ \widehat{\operatorname{sim}} sim 是经过标准化的语义相似度;
  • Q i ^ \widehat{Q_i} Qi 是经过标准化的记忆效用;
  • λ \lambda λ 控制语义相关性和历史效用之间的权重;
  • 最终从候选中选择 Top- k 2 k_2 k2 条经验。

这一阶段回答的是:

在语义相关的经验中,哪些经验过去真正帮助 Agent 获得过成功?

3. 为什么要先语义召回,再按价值排序?

如果只按语义相似度:

可能召回内容相关但历史上经常失败的经验。

如果只按 Q 值:

可能召回历史成功率很高、但与当前任务完全无关的经验。

因此,两阶段检索实际上分别承担:

语义相似度:
保证经验与当前任务相关。

Q 值:
保证经验具有实际帮助。

论文将两者之间的关系概括为:

Similarity 保证 relevance,Q-value 保证 helpfulness。

4. 为什么需要标准化?

相似度和 Q 值可能位于不同的数值分布中。

如果直接相加,其中一个数值范围更大的指标可能完全主导排序。

因此,论文使用 z-score 对二者进行标准化,使其具有可比较的尺度。


八、记忆上的非参数强化学习

MemRL 的核心学习发生在记忆空间中。

当 Agent 使用召回经验完成任务后,环境会返回奖励 r r r

系统只更新实际被加入上下文的记忆,而不是更新整个记忆库。

1. 完整的时序差分更新

理论上,Q 值可以使用时序差分方法更新:

Q ( s , m ) ← Q ( s , m ) + α [ r + γ max ⁡ m ′ Q ( s ′ , m ′ ) − Q ( s , m ) ] Q(s,m)\leftarrow Q(s,m)+\alpha\left[r+\gamma\max_{m'}Q(s',m')-Q(s,m)\right] Q(s,m)Q(s,m)+α[r+γmmaxQ(s,m)Q(s,m)]

其中:

  • α \alpha α 是学习率;
  • r r r 是当前环境奖励;
  • γ \gamma γ 是折扣因子;
  • s ′ s' s 是下一状态;
  • m ′ m' m 是下一状态下可能选择的记忆。

2. 论文实际使用的简化更新

论文把每个任务视为近似的一步决策过程,因此使用 Monte Carlo 风格的简化规则:

Q n e w = Q o l d + α ( r − Q o l d ) Q_{\mathrm{new}}=Q_{\mathrm{old}}+\alpha\left(r-Q_{\mathrm{old}}\right) Qnew=Qold+α(rQold)

这可以写成:

Q n e w = ( 1 − α ) Q o l d + α r Q_{\mathrm{new}}=(1-\alpha)Q_{\mathrm{old}}+\alpha r Qnew=(1α)Qold+αr

从第二种形式可以更直观地看出:

新的 Q 值,是旧效用估计和本次任务奖励的加权平均。

例如:

旧 Q 值:0.6
本次奖励:1
学习率 α:0.2

更新后:

Qnew = 0.6 + 0.2 × (1 - 0.6)
     = 0.68

如果本次任务失败,奖励为 0:

Qnew = 0.6 + 0.2 × (0 - 0.6)
     = 0.48

随着同一经验被多次使用,Q 值会逐渐逼近它的真实平均回报。

3. 新经验如何写入?

每次任务结束后,系统会让 LLM 总结当前执行轨迹,并生成新的 Experience。

然后将其写入记忆库:

当前任务意图 z
+
执行经验 enew
+
初始效用 Qinit

形成新的三元组:

(z, enew, Qinit)

因此,MemRL 同时进行两种记忆更新:

  1. 更新被使用旧记忆的 Q 值;
  2. 将本轮执行轨迹总结成新经验。

这使记忆库能够一边增长,一边学习哪些经验更值得使用。


九、一个简单例子:MemRL 如何学习经验价值?

假设一个操作系统 Agent 需要处理以下任务:

任务:
把 logs 目录中的所有 .txt 文件移动到 backup 目录。

记忆库中存在三条候选经验。

1. 候选经验

经验 A
Intent:移动某类文件到目标文件夹
Experience:
先检查目标目录是否存在;
不存在时使用 mkdir -p 创建;
再执行 mv logs/*.txt backup/。
Q:0.92
经验 B
Intent:移动文件到另一个目录
Experience:
直接执行 mv logs/*.txt backup/。
Q:0.35
经验 C
Intent:复制日志文件
Experience:
使用 cp logs/*.txt backup/。
Q:0.88

2. 第一阶段:语义召回

A、B、C 都与文件迁移任务存在一定语义相似性,因此可能进入候选池。

3. 第二阶段:价值选择

经验 C 的 Q 值很高,但它解决的是“复制”,而不是“移动”,语义相似度相对较低。

经验 B 与当前任务很相似,但历史效用较低。

经验 A 同时具备:

  • 较高语义相关性;
  • 较高历史效用。

因此,经验 A 最终被选入上下文。

4. 环境反馈

Agent 根据经验 A 成功完成任务,获得奖励:

r = 1

系统进一步提高经验 A 的 Q 值。

同时,本次执行轨迹也会被总结为一条新经验,加入记忆库。

随着类似任务不断出现,系统会越来越倾向于召回带有目录检查和容错步骤的经验。

这就是 MemRL 所说的运行时自我进化:

模型参数没有发生变化,但 Agent 对经验的选择越来越准确。


十、理论稳定性分析

论文不仅给出了经验性结果,还从强化学习角度分析了 Q 值更新的稳定性。

分析依赖两个基本假设:

  1. 冻结的 LLM 推理策略保持不变;
  2. 任务分布相对平稳。

对于状态—记忆组合 ( s , m ) (s,m) (s,m),定义真实预期效用:

β ( s , m ) = E [ r t ∣ s , m ] \beta(s,m)=\mathbb{E}[r_t\mid s,m] β(s,m)=E[rts,m]

论文证明,在使用前面的增量更新规则后,当更新次数逐渐增加:

lim ⁡ t → ∞ E [ Q t ] = β ( s , m ) \lim_{t\to\infty}\mathbb{E}[Q_t]=\beta(s,m) tlimE[Qt]=β(s,m)

也就是说:

Q 值的期望会逐渐收敛到使用该记忆时的真实平均回报。

论文还给出了方差上界:

lim sup ⁡ t → ∞ Var ⁡ ( Q t ) ≤ α 2 − α Var ⁡ ( r t ∣ s , m ) \limsup_{t\to\infty}\operatorname{Var}(Q_t)\leq\frac{\alpha}{2-\alpha}\operatorname{Var}(r_t\mid s,m) tlimsupVar(Qt)2ααVar(rts,m)

这个公式说明,Q 值估计的波动受到学习率 α \alpha α 和奖励方差的控制。

当学习率较小时:

  • Q 值变化更加平稳;
  • 对单次异常奖励不那么敏感;
  • 但适应新情况的速度较慢。

当学习率较大时:

  • 系统适应更快;
  • 但 Q 值更容易受到随机奖励影响。

1. 检索分布变化的问题

随着 Q 值不断更新,系统召回记忆的分布也会发生变化。

例如,高 Q 记忆更容易被选中,被选中后又会获得更多反馈。

论文把这一过程解释为一种广义 EM 过程:

策略改进阶段:
根据当前 Q 值优化记忆排序。

价值更新阶段:
根据新奖励更新记忆 Q 值。

论文认为,二者交替进行,可以使全局记忆效用逐渐达到稳定点。

不过,这一理论结论依赖冻结模型、平稳任务分布等假设。在真实开放环境中,任务分布和模型服务版本都可能变化,因此需要谨慎理解其适用范围。


十一、实验设置

1. 数据集

论文在四类不同任务上评估 MemRL。

BigCodeBench

BigCodeBench 用于评估代码生成能力。

任务通常要求模型根据自然语言描述生成可以通过测试用例的 Python 函数。

这类任务可以检验:

  • 代码模板复用;
  • API 使用经验;
  • 错误模式总结;
  • 跨代码任务经验迁移。

Lifelong Agent Bench

论文使用其中两类任务:

  • OS Task:操作系统交互;
  • DB Task:数据库交互。

这类任务需要 Agent:

  • 选择工具;
  • 执行连续操作;
  • 根据环境结果调整策略;
  • 复用历史程序性经验。

ALFWorld

ALFWorld 是文本化具身任务环境。

Agent 需要在家庭环境中完成:

  • 寻找物品;
  • 移动物品;
  • 清洁或加热物品;
  • 执行多步探索。

这种任务具有较强的探索性,适合检验历史策略能否帮助减少无效尝试。

Humanity’s Last Exam

HLE 包含多领域高难度问题,主要用于评估模型在知识和推理前沿上的能力。

与 OS、DB 和 ALFWorld 相比,HLE 内部任务之间的相似性较低,因此跨任务经验复用更困难。

2. 对比方法

论文对比了:

  • No Memory:不使用外部记忆;
  • Pass@10:通过多次采样扩大测试时搜索;
  • RAG:普通语义检索;
  • Self-RAG:带有自我评估和检索控制的 RAG;
  • Mem0:基于事实提取和更新的长期记忆;
  • MemP:基于程序性记忆的 Agent 方法;
  • MemRL:本文方法。

所有方法均在冻结主干模型的条件下进行比较。

3. 两种实验设置

论文分别评估:

Runtime Learning

在相同任务集合上运行多个 epoch,观察 Agent 是否能够在持续交互和记忆反馈中不断提升。

Transferring

在训练任务上积累记忆后,将记忆用于未见过的新任务,评估经验的迁移能力。

4. Backbone

不同数据集使用不同模型,以避免出现:

  • 模型太弱,几乎没有成功奖励;
  • 模型太强,任务已经达到天花板。

主要包括:

数据集 Backbone
BigCodeBench GPT-4o
Lifelong Agent Bench OS GPT-4o-mini
Lifelong Agent Bench DB GPT-4o-mini
ALFWorld GPT-5-mini
HLE Gemini-3-pro

5. 评测指标

论文使用两个主要指标。

Success Rate

Success Rate 表示当前 epoch 中成功完成的任务比例。

可以简化表示为:

SR ⁡ t = 第  t  个 epoch 成功任务数 任务总数 \operatorname{SR}_t=\frac{\text{第 }t\text{ 个 epoch 成功任务数}}{\text{任务总数}} SRt=任务总数 t  epoch 成功任务数

它反映 Agent 当前阶段的即时能力。

Cumulative Success Rate

Cumulative Success Rate 表示截至当前 epoch,至少被成功解决过一次的任务比例。

CSR ⁡ t = 前  t  个 epoch 中至少成功一次的任务数 任务总数 \operatorname{CSR}_t=\frac{\text{前 }t\text{ 个 epoch 中至少成功一次的任务数}}{\text{任务总数}} CSRt=任务总数 t  epoch 中至少成功一次的任务数

例如,一个任务在第 2 个 epoch 成功、之后又失败:

  • 它会继续计入 CSR;
  • 但不会计入当前 epoch 的 SR。

因此:

SR:
当前这一轮能解决多少任务。

CSR:
运行到目前为止,系统至少探索出过多少任务的有效解法。

CSR 更适合衡量运行时学习是否不断扩大 Agent 的可解决任务集合。


十二、主要实验结果:运行时学习

论文 Table 1 展示了 10 个 epoch 后的运行时学习结果。

运行时学习结果

表源:Zhang et al., 2026,Table 1。

方法 BigCodeBench OS Task DB Task ALFWorld HLE 平均 CSR
RAG 0.483 0.700 0.916 0.930 0.475 0.699
Self-RAG 0.561 0.732 0.898 0.962 0.475 0.726
Mem0 0.495 0.702 0.926 0.969 0.470 0.712
MemP 0.602 0.742 0.966 0.919 0.570 0.760
MemRL 0.627 0.804 0.972 0.981 0.606 0.798

表格中展示的是各方法的 CSR,完整原表同时报告最后一个 epoch 的 Success Rate。

1. 平均结果

MemRL 的平均 CSR 为:

0.798

最强 baseline MemP 为:

0.760

绝对提升为:

3.8 个百分点

2. OS Task

MemRL 在 OS Task 上达到:

0.804

MemP 为:

0.742

绝对提升:

6.2 个百分点

操作系统任务内部通常包含相似的文件、目录和命令操作,因此成功经验更容易跨任务迁移。

3. ALFWorld

MemRL 的 CSR 为:

0.981

MemP 为:

0.919

同样提升 6.2 个百分点。

ALFWorld 具有明显的探索性质。过去成功的物品搜索和操作策略,能够帮助 Agent 减少后续任务中的无效尝试。

4. HLE

MemRL 在 HLE 上达到:

0.606

MemP 为:

0.570

提升 3.6 个百分点。

虽然 HLE 内部问题差异较大,但价值感知检索仍然能够过滤部分语义相关但作用有限的经验。

5. Mem0 的表现

Mem0 的平均 CSR 为 0.712,低于 MemRL。

这并不意味着 Mem0 本身是无效的,而是因为两者主要解决的问题不同:

Mem0:
管理长期事实的增、改、删。

MemRL:
学习程序性经验的任务效用。

对于代码、工具调用和环境交互任务,程序性经验和价值反馈更直接。


十三、迁移实验

论文 Table 2 评估将训练过程中积累的记忆用于未见任务的能力。

迁移学习结果

表源:Zhang et al., 2026,Table 2。

方法 BigCodeBench OS Task DB Task ALFWorld 平均
No Memory 0.485 0.673 0.841 0.836 0.709
RAG 0.479 0.713 0.920 0.950 0.765
Self-RAG 0.500 0.653 0.881 0.950 0.746
Mem0 0.485 0.686 0.935 0.950 0.764
MemP 0.494 0.720 0.928 0.921 0.766
MemRL 0.508 0.746 0.942 0.979 0.794

MemRL 在四个任务上都取得了最高结果。

这说明它学到的不只是对原始任务的答案缓存,还包含一定可迁移的策略,例如:

  • 代码结构;
  • 工具调用顺序;
  • 数据库查询模式;
  • 环境探索步骤;
  • 常见失败规避方法。

十四、消融实验:运行时强化学习是否有效?

论文 Figure 4 对比了带有运行时 RL 的 MemRL 和普通记忆方法。

OS互动表现

图源:Zhang et al., 2026,Figure 4。

实验中:

  • MemRL 与 MemP 对比;
  • 带 Q 值更新的 RAG 变体与普通 RAG 对比。

在初始阶段,各方法表现接近。

随着 epoch 增加:

  • MemRL 的成功率逐渐提高;
  • CSR 差距持续扩大;
  • 学习曲线更加平稳。

这说明性能提升不是单纯来自“存了更多经验”,而是来自:

环境反馈逐渐改变了记忆的价值排序。

普通记忆系统虽然也不断积累内容,却无法区分哪些经验真正有效,因此记忆增加也可能增加噪声。


十五、Q 值权重的影响

论文使用 λ \lambda λ 控制语义相似度与 Q 值的权重:

score ⁡ = ( 1 − λ ) sim ⁡ ^ + λ Q ^ \operatorname{score}=(1-\lambda)\widehat{\operatorname{sim}}+\lambda\widehat{Q} score=(1λ)sim +λQ

论文测试:

λ = 0
λ = 0.25
λ = 0.5
λ = 0.75
λ = 1

结果如 Figure 5 所示。

Q值权重消融实验

图源:Zhang et al., 2026,Figure 5。

结果整体呈倒 U 型, λ = 0.5 \lambda=0.5 λ=0.5 表现最好。

1. λ = 0

此时系统只考虑语义相似度:

score = similarity

系统无法过滤“语义相关但历史上无效”的经验,因此性能较早进入平台期。

2. λ = 1

此时系统只考虑 Q 值:

score = Q

高 Q 记忆可能与当前任务不够相关,导致上下文脱离当前意图,并带来较大波动。

3. λ = 0.5

相似度和效用具有相同权重,实现了:

相关性
+
历史有效性

之间的平衡。

这项实验说明,Q 值不能完全替代语义检索,它更适合被视为第二阶段的价值校正信号。


十六、跨任务优化与单任务反思

论文 Table 3 比较了:

  • Single-Task Reflection:只利用当前任务自己的历史反馈;
  • MemRL Cross-Task:允许从其他相似任务中召回经验。
设置 BigCodeBench OS DB ALFWorld HLE 平均
Single-Task Reflection 0.614 0.714 0.938 0.930 0.610 0.761
MemRL Cross-Task 0.627 0.804 0.972 0.981 0.606 0.798

1. OS Task

跨任务记忆从:

0.714 → 0.804

绝对提升 9 个百分点。

这说明不同操作系统任务之间存在可复用的程序性策略。

2. ALFWorld

跨任务记忆提升:

0.930 → 0.981

绝对提升 5.1 个百分点。

环境探索、物品定位和动作顺序具有较强的可迁移性。

3. HLE

Single-Task Reflection 为:

0.610

MemRL 为:

0.606

两者基本持平,单任务反思还略高。

论文认为,HLE 内部问题平均语义相似度较低,不同问题之间很难共享经验。

因此,MemRL 的跨任务优势具有一个重要前提:

任务分布中必须存在足够多可以复用的结构或策略。

如果任务之间完全无关,MemRL 会逐渐退化为类似单任务反思的方法。


十七、召回数量的敏感度

论文测试了三组召回配置:

稀疏:
k1 = 3,k2 = 1

中等:
k1 = 5,k2 = 3

密集:
k1 = 10,k2 = 5

其中:

  • k 1 k_1 k1 是第一阶段召回的候选数量;
  • k 2 k_2 k2 是第二阶段最终加入上下文的经验数量。

结果如 Figure 6 所示。

召回大小的消融实验

图源:Zhang et al., 2026,Figure 6。

结果同样呈倒 U 型:

  • 召回过少,经验不足;
  • 召回过多,上下文噪声增加;
  • 中等配置表现最好。

最优配置为:

k1 = 5
k2 = 3

这说明:

记忆系统的效果并不随着召回数量单调增加。

关键是提高有用信息与噪声之间的比例,而不是把尽可能多的历史经验塞进上下文。


十八、Q Critic 是否真的能够预测任务成功?

Q 值的核心作用是估计一条记忆未来是否有用。

如果 Q 值与真实成功率无关,那么价值感知检索就没有意义。

论文 Figure 7 将记忆按 Q 值分组,并统计每组经验对应的下游任务成功率。

Q值分析图

图源:Zhang et al., 2026,Figure 7。

1. Q 值和成功率高度相关

最低 Q 值区间的任务成功率为:

21.5%

最高 Q 值区间为:

88.1%

Pearson 相关系数为:

r = 0.861

这说明 Q 值与真实成功概率存在较强正相关。

因此,Q Critic 确实能够用于区分高效用和低效用经验。

2. 高 Q 记忆中仍然存在失败经验

在最高 Q 值区间中,大约仍有:

12%

的记忆来自失败任务。

这说明 Q 值并不是简单记录:

成功经验 = 1
失败经验 = 0

部分失败轨迹虽然没有直接完成任务,但可能包含有用信息,例如:

  • 找到了正确的工具;
  • 排除了错误路径;
  • 暴露了关键环境约束;
  • 只在最后一步出错;
  • 提供了可以迁移的局部策略。

因此,失败经验也可能具有较高的程序性价值。


十九、MemRL 的稳定性与遗忘

论文从 Success Rate 和 CSR 的差距分析记忆系统的稳定性。

如果某种方法的 CSR 不断提高,但当前 Success Rate 明显下降,说明:

系统过去曾解决过这些任务,
但当前已经无法再次完成。

这可以被视为一种遗忘。

论文 Figure 8 比较了 MemRL 和 MemP 在 HLE 上的长期曲线。

周期成功率

图源:Zhang et al., 2026,Figure 8。

MemP 的 CSR 和当前成功率之间逐渐出现更大差距,而 MemRL 的两条曲线增长更加同步。

论文还定义了遗忘率:

FR ⁡ = N l o s t N f a i l \operatorname{FR}=\frac{N_{\mathrm{lost}}}{N_{\mathrm{fail}}} FR=NfailNlost

其中:

  • N l o s t N_{\mathrm{lost}} Nlost 表示此前成功、当前变为失败的任务数量;
  • N f a i l N_{\mathrm{fail}} Nfail 表示当前 epoch 中失败任务总数。

实验结果为:

MemRL:0.041
MemP:0.051

移除 z-score 标准化和相似度门控后,遗忘率上升到:

0.073

这说明以下两项设计对稳定性很重要:

  1. 先用严格语义阈值过滤无关经验;
  2. 标准化相似度和 Q 值,防止某个信号异常主导排序。

二十、跨模型记忆迁移

论文附录还进行了一个很有意思的实验:

用强模型积累经验,再把记忆库直接交给其他模型使用。

研究者首先用 Gemini-3-pro 在 HLE 上运行 10 个 epoch,得到成熟记忆库。

随后,不进行任何微调,直接把这份记忆交给三个不同模型。

推理模型 原始得分 使用迁移记忆 绝对提升
Qwen3-235B 0.150 0.531 +0.381
Gemini-3-flash 0.347 0.583 +0.236
GPT-5.2 High 0.354 0.571 +0.217

Qwen3-235B 的结果提升超过三倍,Gemini-3-flash 接近翻倍。

这说明 MemRL 记忆中保存的并不完全是特定模型的输出习惯,而可能包含相对通用的:

  • 解题模板;
  • 代码框架;
  • 推理策略;
  • 问题拆解方式;
  • 常见错误规避方案。

从工程角度看,记忆库可以成为一种可迁移的外部能力模块:

强模型负责探索并积累经验
→ 弱模型通过召回继承这些经验

不过,不同模型对经验格式和指令的理解能力仍然不同,迁移效果不一定在所有任务中都如此明显。


二十一、MemRL 的优势

1. 不需要更新模型参数

运行时学习发生在外部记忆中,不需要:

  • 反向传播;
  • 保存优化器状态;
  • 在线微调;
  • 修改推理模型。

因此,它更容易接入闭源 API 模型。

2. 能够利用环境反馈

MemRL 不只保存任务轨迹,还利用成功或失败奖励学习经验价值。

这让系统可以逐渐区分:

看起来相关

和:

实际有帮助

3. 支持跨任务经验迁移

相似任务可以共享程序性经验,尤其适合:

  • 操作系统任务;
  • 数据库任务;
  • 代码任务;
  • 环境探索任务。

4. 可以保留模型稳定性

模型权重保持冻结,因此不会因为记忆更新直接破坏模型已有能力。

5. 记忆库具有一定可移植性

一套由强模型积累的经验,可以被其他推理模型复用。

6. 能学习失败经验的潜在价值

Q 值并不是简单的成功标签,还能识别具有局部价值的失败轨迹。


二十二、局限性

1. 单步 Q 值更新可能存在较高方差

当前方法主要根据单次任务结果更新经验:

Q n e w = Q o l d + α ( r − Q o l d ) Q_{\mathrm{new}}=Q_{\mathrm{old}}+\alpha(r-Q_{\mathrm{old}}) Qnew=Qold+α(rQold)

在长轨迹任务中,最终奖励可能受到很多步骤共同影响。

如果只根据最终成功或失败更新所有被召回经验,容易产生噪声。

未来可以考虑:

  • 多步 TD 更新;
  • 周期性记忆巩固;
  • 更平滑的奖励估计;
  • 根据轨迹阶段分配奖励。

2. 多条记忆之间存在信用分配问题

如果一次任务同时召回三条经验,并最终成功,很难准确判断:

是哪一条经验真正发挥了作用?

当前方法会更新所有被加入上下文的记忆,可能把奖励错误分配给无关经验。

论文提出未来可以使用:

  • Shapley Value;
  • 价值分解;
  • 多智能体强化学习中的信用分配方法。

3. 依赖可获得的环境奖励

MemRL 需要知道任务是否成功。

这在以下任务中比较容易:

  • 单元测试;
  • 数据库执行;
  • 文件操作;
  • ALFWorld 环境任务。

但在开放式对话中,奖励不容易定义:

这次建议究竟算成功还是失败?
用户是否真的满意?
一段回答的长期价值如何判断?

因此,MemRL 更适合具有明确反馈信号的任务环境。

4. 任务相似度较低时,跨任务学习有限

HLE 实验表明,当任务之间缺少共享结构时,跨任务记忆的优势明显减弱。

这意味着 MemRL 不是在任意任务分布下都能持续获得同样幅度的提升。

5. 记忆库会持续增长

每次任务都会生成新的经验三元组。

长期运行后可能出现:

  • 重复经验;
  • 相似策略;
  • 低价值记忆积累;
  • 检索成本增加;
  • Q 值更新次数不均衡。

论文尚未系统解决长期记忆合并、压缩和淘汰问题。

6. 理论分析依赖较强假设

稳定性分析主要假设:

  • 推理模型冻结;
  • 任务分布平稳;
  • 奖励分布相对稳定。

现实 Agent 环境中可能存在:

  • 模型 API 升级;
  • 用户行为变化;
  • 工具接口变化;
  • 任务分布漂移;
  • 奖励标准变化。

这些因素都可能影响 Q 值的长期有效性。

7. 低 Q 不一定意味着记忆应被删除

某条经验可能只对少数特殊任务有效。

如果它在多数任务上表现较差,Q 值可能偏低,但这不代表它没有保留价值。

更细粒度的方案可能需要学习:

Q(intent, experience)

而不是为每条经验维护过于全局化的单一效用。


二十三、和 Memory-R1、AgeMem、Mem0、A-Mem 的区别

方法 学习对象 是否更新模型权重 核心机制
Memory-R1 记忆写入和利用策略 强化学习训练记忆管理策略
AgeMem STM/LTM 工具调用策略 渐进式 RL 统一记忆动作
Mem0 事实记忆生命周期 ADD、UPDATE、DELETE、NOOP
A-Mem 记忆链接与结构 动态建链和记忆演化
MemRL 记忆的任务效用和召回策略 Q 值更新与两阶段价值召回

1. MemRL 和 Memory-R1

Memory-R1 通过强化学习训练模型,使其学会:

  • 写入哪些记忆;
  • 如何更新记忆;
  • 如何利用已有记忆。

强化学习结果进入模型参数。

MemRL 则保持模型参数冻结,只更新外部记忆的 Q 值。

Memory-R1:
学习发生在模型参数中。

MemRL:
学习发生在记忆效用中。

2. MemRL 和 AgeMem

AgeMem 将添加、更新、删除、总结、过滤和召回等操作暴露为工具,让 Agent 通过强化学习学会何时操作短期和长期记忆。

MemRL 不重点学习完整的记忆操作流程,而是聚焦:

在已有经验中应该选择哪几条?

因此,AgeMem 更偏记忆管理策略,MemRL 更偏经验价值学习。

3. MemRL 和 Mem0

Mem0 主要处理自然语言事实:

用户喜欢什么?
用户在哪里工作?
哪些事实已经变化?

MemRL 主要处理程序性经验:

这个任务应该怎样完成?
哪套策略过去更有效?
某类环境应该使用什么操作顺序?

可以简单理解为:

Mem0:
记住“是什么”。

MemRL:
记住“怎么做”,并学习哪种做法更有效。

4. MemRL 和 A-Mem

A-Mem 通过关键词、标签和动态链接组织记忆,使记忆网络能够不断演化。

MemRL 不重点构建复杂关系图,而是为记忆增加可学习的效用信号。

二者可以结合:

A-Mem:
负责结构化关联和多跳扩展。

MemRL:
负责根据环境反馈学习每条经验的价值。

二十四、我的理解和启发

这篇论文给我的最大启发是:

Agent 记忆系统不应该只学习“记住什么”,还应该学习“哪些记忆值得相信和复用”。

1. 相似度不等于有效性

自己做记忆系统时,通常会使用:

  • 向量相似度;
  • BM25;
  • 标签匹配;
  • 规则召回。

这些方法主要衡量相关性,却没有衡量使用结果。

可以为每条程序性记忆增加:

success_count
failure_count
utility_score
last_reward
usage_count
last_used_at

让检索排序同时考虑:

语义相关度
+
历史成功率
+
使用次数
+
最近表现

2. 事实记忆和经验记忆应该分开

自己的 Agent 记忆可以区分:

事实记忆

用户目标岗位是 AI Agent 开发。
项目使用 BM25 和向量混合召回。

适合使用 Mem0 式增改删。

经验记忆

修改大型代码库前先读取入口文件和依赖关系;
工具结果过长时应先落盘再保留引用;
处理 Redis 连接错误时先检查服务和端口。

适合使用 MemRL 式效用学习。

二者的更新逻辑不应该完全相同。

3. 可以为工具调用经验增加奖励

在代码 Agent 中,可以使用自然反馈作为奖励:

环境反馈 奖励示例
测试全部通过 1.0
部分测试通过 0.5
编译失败 0
工具调用报错 0
用户接受修改 1.0
用户要求回滚 0

然后更新实际使用经验的效用值。

4. 两阶段召回值得直接借鉴

可以把自己的混合检索改成:

第一阶段:
BM25 + 向量检索,获得语义相关候选。

第二阶段:
综合相关性、历史成功率和置信度重排。

例如:

score ⁡ = w 1 ⋅ similarity ⁡ + w 2 ⋅ utility ⁡ + w 3 ⋅ confidence ⁡ \operatorname{score}=w_1\cdot\operatorname{similarity}+w_2\cdot\operatorname{utility}+w_3\cdot\operatorname{confidence} score=w1similarity+w2utility+w3confidence

为了适配 CSDN 和工程实现,这里使用简化表达。

5. 不要简单删除失败经验

失败经验可能包含:

  • 已经验证无效的方案;
  • 需要避免的参数;
  • 某个工具的限制;
  • 失败发生的位置;
  • 可以复用的前半段步骤。

因此,可以将经验总结为:

有效步骤
失败原因
适用条件
不可用条件

而不是只保留成功轨迹。

6. 需要处理多记忆信用分配

如果一次任务使用了多条经验,可以先使用简单方法:

被直接引用的核心经验:
获得完整奖励。

仅作为辅助背景的经验:
获得折扣奖励。

未被模型实际采用的经验:
不更新。

后续可以根据模型生成内容与经验之间的引用关系,做更精细的价值归因。

7. 可以与现有记忆模块组合

结合前面阅读的论文,可以设计:

Mem0:
维护用户事实的新增、更新和删除。

Zep:
保存关系和时间变化。

GAM:
在语义边界后再固化长期记忆。

A-Mem:
建立经验之间的结构化关联。

MemRL:
利用环境反馈更新经验的效用值。

LightMem:
离线合并、压缩和清理低价值记忆。

这几个方法分别作用于记忆生命周期的不同阶段,并不互相冲突。


二十五、未来可以如何改造自己的项目?

可以在当前结构化记忆系统中,为经验记忆增加如下结构:

{
  "intent": "修复 Redis 连接失败",
  "experience": {
    "strategy": "先检查 redis-server 是否运行,再检查端口和配置文件",
    "successful_steps": [
      "使用 ps 或 brew services 检查 Redis 状态",
      "使用 lsof 检查端口占用",
      "确认客户端连接地址"
    ],
    "failure_notes": [
      "只修改代码无法解决服务未启动的问题"
    ]
  },
  "utility": 0.72,
  "usage_count": 5,
  "success_count": 4,
  "failure_count": 1,
  "source_task": "redis_connection_error",
  "embedding": "..."
}

召回可以分成:

Query
→ Intent embedding 召回 Top-5
→ 相似度阈值过滤
→ 相似度与 utility 联合排序
→ 选择 Top-3
→ 加入 Agent 上下文

任务结束后:

自动测试 / 工具反馈 / 用户确认
→ 生成 reward
→ 更新 utility
→ 总结本轮新经验
→ 写入记忆库

这种改造不需要训练模型参数,比较适合本地 Agent 项目。


二十六、总结

本文提出了 MemRL,一种通过情景记忆上的非参数强化学习实现 Agent 运行时自我进化的方法。

现有记忆系统通常使用语义相似度召回经验,但“语义相关”并不等于“实际有用”。MemRL 为每条经验增加 Q 值,根据环境反馈持续学习经验的任务效用。

MemRL 将记忆表示为:

Intent
+
Experience
+
Utility

其中:

  • Intent 描述经验对应的原始任务;
  • Experience 保存解决策略或执行轨迹;
  • Utility 使用 Q 值表示经验的预期任务回报。

在召回阶段,MemRL 使用两阶段策略:

  1. 根据语义相似度召回候选经验;
  2. 根据相似度和 Q 值联合排序,选择真正有用的记忆。

在任务结束后,系统根据环境奖励更新被使用经验的 Q 值:

Q n e w = Q o l d + α ( r − Q o l d ) Q_{\mathrm{new}}=Q_{\mathrm{old}}+\alpha(r-Q_{\mathrm{old}}) Qnew=Qold+α(rQold)

同时,当前执行轨迹会被总结成新经验写入记忆库。

实验结果表明:

  • MemRL 在四类任务上的平均 CSR 达到 0.798;
  • 相比最强 baseline MemP 提升 3.8 个百分点;
  • 在 OS 和 ALFWorld 上均提升 6.2 个百分点;
  • 迁移任务平均成功率达到 0.794;
  • 相似度和 Q 值各占一半时效果最好;
  • 中等召回规模 k 1 = 5 , k 2 = 3 k_1=5,k_2=3 k1=5,k2=3 表现最好;
  • Q 值与下游成功率的 Pearson 相关系数达到 0.861;
  • MemRL 的平均遗忘率为 0.041,低于 MemP 的 0.051;
  • 强模型积累的记忆可以直接迁移给其他模型使用。

整体来看,MemRL 的核心价值在于:

它把强化学习从模型参数空间转移到了外部记忆空间。

Agent 不需要频繁微调模型,也可以通过持续交互逐渐学习:

  • 哪些经验值得复用;
  • 哪些经验只是语义相似的噪声;
  • 哪些失败轨迹仍然包含有价值的策略;
  • 哪些经验能够迁移到其他任务和模型。

这为 Agent 运行时持续学习提供了一条相对轻量的路径:

模型保持稳定,记忆持续进化。


参考资料

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐