Meta:经验回放降低大模型训练成本

📖标题:Efficient RL Training for LLMs with Experience Replay
🌐来源:arXiv, 2604.08706v1
🛎️文章简介
🔸研究问题:在大语言模型强化学习后训练中,必须丢弃单次使用的轨迹数据才能保持高性能,还是可以通过经验回放复用数据来显著降低计算成本?
🔸主要贡献:论文挑战了严格在线策略训练的共识,证明设计良好的经验回放缓冲区能在不降低甚至提升模型性能的前提下,节省高达 40% 的推理计算资源。
📝重点思路
🔸提出异步训练架构下的经验回放机制,将生成的轨迹存入缓冲区供训练器多次采样,打破生成与训练强耦合导致的“生成即丢弃”低效模式。
🔸建立理论框架量化计算效率、样本多样性与梯度偏差之间的权衡,推导出最优缓冲区大小和回放比例,证明当推理成本高昂时,适度偏离在线策略是最优解。
🔸通过实验系统分析缓冲区超参数影响,发现增大缓冲区虽增加数据陈旧度但能作为正则化项稳定训练,而过度重用样本会降低局部多样性从而损害性能。
🔸探索进阶优化策略,包括偏向正样本的采样规则以及使用不对称强化学习损失函数,进一步提升了在非在线数据分布下的训练稳定性和效率。
🔎分析总结
🔸实验表明,合理配置的回放缓冲区可节省约 40% 的计算预算即可达到与严格在线策略基线相同的准确率,且在部分配置下最终精度更高。
🔸引入经验回放能有效平滑异步流水线中的等待延迟,解耦生产与消费过程,不仅降低了理论计算量,在实际墙钟时间上也获得了显著加速。
🔸适度的数据陈旧性和样本重用并未导致模型输出多样性 collapse,反而在 pass@k 指标上表现更好,说明旧策略数据增加了训练分布的多样性并防止过拟合。
🔸过于激进的回放比例会导致局部样本多样性急剧下降进而降低性能,但通过调整缓冲区大小和采样策略可以找到效率与精度的最佳平衡点。
💡个人观点
论文将经典强化学习中的经验回放技术迁移至 LLM 后训练场景,其实就是RL训练的时候离线数据用多久。

更多推荐
所有评论(0)