RLSD:让大模型在自我进化中避免“作弊“的训练新范式
在大模型后训练领域,如何高效地让模型学会复杂推理能力一直是核心挑战。当前主流的两条技术路线各有利弊:基于可验证奖励的强化学习(RLVR,如GRPO)能从环境反馈中获得可靠的更新方向,但信号过于稀疏——整条推理轨迹只能得到一个"对"或"错"的标量奖励,无法判断究竟哪一步推理是关键;在策略蒸馏(OPD)则利用更强的教师模型提供密集的token级信号,但需要额外的大模型支撑,成本高昂。近期兴起的在策略自蒸馏(OPSD)试图折中:让同一个模型同时扮演教师和学生,教师端额外输入参考答案等特权信息来指导学生。然而,中国科学院信息工程研究所与京东的研究团队(Chenxu Yang、Chuanyu Qin、Qingyi Si等)在论文《Self-Distilled RLVR》中指出,这种看似优雅的方案存在根本性缺陷——教师与学生之间的信息不对称会导致严重的特权信息泄露,模型在推理时会"幻觉"出不存在的参考答案,长期训练极不稳定。为此,该团队提出了RLSD(RLVR with Self-Distillation)方法,将自蒸馏重新定位为token级更新幅度的评估器,而将更新方向牢牢锚定在环境奖励上,从而兼得两者的优势。

表1系统对比了当前大模型后训练的主流范式。 从表中可以看出,SFT虽然信号丰富但属于离策略学习,且方向依赖教师;GRPO(RLVR的代表)方向由环境锚定、效率高,但信号过于稀疏;OPD信号丰富、方向由教师锚定,但效率低下;OPSD效率高、信号丰富,但存在严重的信息泄露风险;而RLSD在保持高效率的同时,信号丰富且方向由环境锚定,不存在泄露风险,是唯一同时满足所有理想特性的范式。
论文深入剖析了OPSD失败的根源。在OPD中,教师和学生观察相同的输入(信息对称),教师的密集信号反映的是在相同信息条件下的更优推理;而在OPSD中,教师条件化了学生无法观测的特权信息(信息不对称),这种根本性的错位使得分布匹配目标在结构上就是不适定的。研究者从目标函数和梯度两个层面形式化地证明了这一点:信息不对称引入了不可消除的互信息间隙,驱动模型将特权信息"编码"进自身参数中。

图2展示了一个OPSD训练模型出现特权信息泄露的典型例子。 在推理阶段,模型竟然"援引"了一个隐形的参考答案——它并没有真正看到答案,却在推理过程中表现出仿佛已经知道答案的行为,这正是信息泄露的直接证据。

图3进一步从三个维度揭示了OPSD及其变体的动态行为。 子图(a)展示了泄露发生的时间动态,可以看到泄露随训练进行而逐渐加剧;子图(b)显示验证集性能呈现"先升后降"的典型模式——早期获得收益后出现系统性崩溃;子图(c)的KL散度对比则印证了模型分布随训练逐渐偏离合理范围。这种"早期收益、后期崩溃"的现象在实验中反复出现,恰恰对应了信息不对称导致的结构性缺陷。
RLSD的核心洞见在于:与其强迫学生去模仿教师的条件分布(这正是泄露的根源),不如将教师与学生之间的分布差异重新利用起来,作为token级更新幅度的精细控制器。具体而言,环境奖励(如答案正确性)决定每个token的更新方向——是强化还是惩罚;而教师端计算出的证据比(evidence ratio)仅调制更新幅度的大小。这种解耦设计使得梯度方向完全锚定在可靠的环境奖励上,同时保留了教师提供的密集、token级评估能力,用于在token位置之间进行细粒度的信用分配。

图5对比了多模型推理任务上的训练动态。 子图(a)的训练奖励曲线显示,RLSD能够持续稳定提升,而OPSD在达到某个峰值后开始下降;子图(b)的训练熵动态则表明,RLSD在保持探索能力的同时避免了熵的异常坍缩,展现出更健康的训练行为。

图6以两个多模态推理示例展示了RLSD下的token级信用热力图。 在上方正确的推理轨迹中,较大的信用值集中在决定性的计数和减法步骤上;在下方错误的轨迹中,最强的惩罚被分配给了误读柱状图关系以及由此推导出的错误答案。绿色表示较大的token级信用幅度,红色表示较小的幅度。这种精细的信用分配能力正是RLSD相较于传统RLVR方法的核心优势——它不再对所有token一视同仁,而是能够识别出推理链中真正关键的步骤。

在实验验证方面,研究团队在Qwen3-VL-8B-Instruct模型上进行了多模态推理任务的综合评测。表2汇总了五个基准测试上的结果。 RLSD在MMMU、MathVista、MathVision、ZeroBench和WeMath五个基准上分别取得67.22、78.10、52.73、24.85和58.00的成绩,平均准确率达到56.18%,不仅显著超越了基座大模型(51.49%),也全面优于GRPO(53.86%)、OPSD(52.49%)、SDPO(52.74%)以及GRPO+OPSD组合(52.91%)等对比方法。值得注意的是,RLSD相比基座模型提升了4.69个百分点,且在训练过程中未出现OPSD那样的性能退化,验证了其在收敛上限和训练稳定性上的双重优势。
从方法论层面看,RLSD的贡献不仅在于提出了一种新的训练算法,更在于对"自蒸馏应该在大模型训练中扮演什么角色"这一根本问题给出了清晰的答案。传统的自蒸馏思路是将教师分布作为学生优化的目标,这在信息对称时有效,但在信息不对称时必然导致泄露。RLSD跳出了"分布匹配"的框架,将自蒸馏重新定位为强化学习框架内的一个辅助模块——它不再提供目标,而是提供粒度信息。这种思路上的转变,使得原本相互矛盾的两种范式(RLVR的环境锚定与OPSD的密集信号)得以在统一框架内和谐共存。
该工作也引发了后续研究的关注。例如CEPO方法提出用对比证据比(P_T+/P_T-)替代RLSD中的单参考证据比(P_T+/P_S),进一步探索了自蒸馏与强化学习结合的设计空间。这些后续工作从侧面印证了RLSD所开辟方向的价值:在大模型后训练中,如何合理利用模型自身的知识来辅助强化学习,是一个值得深入挖掘的富矿。
综上所述,RLSD通过精巧地解耦"更新方向"与"更新幅度",成功规避了在策略自蒸馏中的信息泄露陷阱,同时继承了其细粒度信号的优势。这一方法为大模型推理能力的提升提供了一条兼具理论严谨性与实践有效性的新路径。
论文链接:https://arxiv.org/pdf/2604.03128
项目链接:https://github.com/iie-ycx/RLSD
更多推荐


所有评论(0)