引言

随着大语言模型从"单轮问答"走向"真实环境中的持续交互",LLM Agent正在被用于越来越复杂的应用场景:深度研究、编程、计算机使用、客服、医疗问诊、故障排查等。

这类任务与传统的单轮问答有一个本质区别:任务所需的信息往往并非在一开始就完整给出。Agent必须在信息不完备的条件下主动采取行动——提问、搜索、调用工具、检查反馈——并在多轮交互中持续更新对任务状态的理解。

这种能力可被概括为主动推理(Active Reasoning):在信息不完备的环境中,Agent不仅需要"回答问题",还需要主动获取信息,并将新信息有效整合到后续决策中。

从过往在推理任务上的成功经验来看,强化学习似乎是训练这类能力的自然选择——任务成功给予正奖励,失败则不给予奖励,模型应当逐步学会更优的交互策略。

然而实际结果并非如此。

一、核心问题:基于结果的强化学习的局限性

由研究者 Deyu Zou、Yongqiang Chen、Fan Feng、Mufei Li、Pan Li、Yu Gong、James Cheng 等人在ICML 2026上发表的论文《On Information Self-Locking in Reinforcement Learning for Active Reasoning of LLM Agents》揭示了一个值得关注的现象:

在主动推理场景中,基于结果的强化学习(outcome-based RL)并不一定能自然地训练出更善于交互的Agent。模型可能陷入一种低信息量的训练模式:反复执行无效操作,过早依赖初始判断,忽略用户或环境返回的新证据。

更值得关注的是,“即使最终reward有所提升,背后的行为也未必真正变得更善于主动获取和使用信息”——这一结论在论文中得到了实验验证。

换言之,RL可能使Agent学会了用看似合理的表面行为"通过"奖励函数的评估,却未真正掌握主动推理的能力。

二、深层机制分析

研究者将这一现象命名为 “信息自锁”(Information Self-Locking)

问题的根源在于:在主动推理任务中,Agent的表现同时依赖于两个相互耦合的能力

能力描述
动作选择(Action Selection, AS)选择何种动作来获取信息(提问、检索、调用工具等)
信念追踪(Belief Tracking, BT)将获取到的信息整合到后续判断中的能力

问题在于,outcome reward难以自动为这两个相互依赖的环节提供清晰的信用分配(credit assignment)

  • 当AS无法带来有效反馈时,BT缺乏可学习的训练信号;
  • 当BT无法正确吸收反馈时,AS的价值难以通过最终reward得到准确评价。

上述两个因素相互强化,形成恶性循环,将Agent锁定在低信息量的训练局部最优中。

三、解决方案:AREW —— 带方向性批评的优势重加权

针对上述问题,作者提出了一个轻量级的方法:AREW(Advantage Reweighting with Directional Critiques,带方向性批评的优势重加权)

AREW的核心思路是:通过引入方向性的批评信号(critiques),重新分配轨迹内部的credit,从而缓解信息自锁效应

具体而言,AREW利用针对AS和BT的批评信号,对轨迹中不同步骤的优势估计进行重加权,以增强模型在动作选择和信念追踪两方面的学习效果。

实验结果

研究者在9个不同复杂度的Agentic任务上进行了广泛的实验,结果表明:

  • AREW显著缓解了信息自锁问题;
  • 在6个基准测试上带来了约 10% 的性能提升(数据源自ICML 2026官方摘要);
  • 该方法已被ICML 2026接收。

四、技术启示与展望

4.1 对RL训练范式的再思考

这项研究提示我们:RL并非万能方案。在复杂的多轮交互场景中,简单的outcome-based reward设计可能适得其反。针对这类任务,需要设计更精细的信用分配机制,以引导Agent真正学会"主动获取信息"和"有效整合信息"两项核心能力。

4.2 与相关工作的关联

此项工作与此前被ICLR 2026接收为Oral的论文 《Reducing Belief Deviation in Reinforcement Learning for Active Reasoning of LLM Agents》(简称T3) 形成了良好的互补。两篇论文在作者团队上存在部分重合(如Deyu Zou、Mufei Li、Pan Li、Yu Gong等),共同指向了一个更深层的问题:如何使RL真正提升Agent的推理能力,而非仅优化表面行为

4.3 未来方向

随着LLM Agent从实验室走向真实生产环境,信息不完备条件下的多轮交互与动态决策将成为常态。如何设计更鲁棒的训练范式,使Agent在复杂环境中真正习得主动推理能力,将是未来RL研究的重要课题。

参考资料

  • 论文标题:On Information Self-Locking in Reinforcement Learning for Active Reasoning of LLM Agents
  • 接收会议:ICML 2026
  • 论文链接:https://arxiv.org/abs/2603.12109

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐