RLHF,全称是 Reinforcement Learning from Human Feedback(基于人类反馈的强化学习),是目前最前沿的大模型对齐技术之一。

通俗地讲,它的目标是:让模型不仅“会说”,更要知道“说什么话人类更喜欢”。

你可以把训练一个强大的大模型想象成培养一个实习生:

  1. 预训练 (Pre-training):让实习生读完图书馆里所有的书,他知识渊博,但说话可能颠三倒四,也不懂礼貌。

  2. 监督微调 (SFT):你给他看了很多“优秀回答范例”(就像你之前的 train_qwen3_4b_v4.json 数据),他学会了“回答问题”的基本格式,比如分步骤、带工具、写安全警示。这时他算是一个合格的初级工程师。

  3. RLHF:这是进阶培训。你不再直接给他正确答案,而是让他针对同一个问题写出多个不同的答案,然后由你(或一个模拟你偏好的模型)来打分:“这个答案我喜欢,因为更安全”、“那个答案我讨厌,因为忽略了关键步骤”。模型通过不断尝试、获得反馈、调整策略,最终学会最大化获得你高分的“行为”

RLHF 的标准流程(三步走)

一个完整的 RLHF 流程通常包含以下三个核心步骤,也是你后续可以探索的进阶路线:

步骤 名称 做什么? 产物
第一步 SFT
(你已经做了)
用“优质问答对”微调基座模型,让它学会回答问题的基本格式和风格。 SFT 模型
第二步 训练奖励模型 (Reward Model, RM) 让人工标注员对同一个问题的 多个不同回答 进行“好坏排序”。然后训练一个专门的“打分模型”来模仿人类的偏好。 奖励模型 (RM)
第三步 近端策略优化 (PPO) 将 SFT 模型与环境(即奖励模型)互动。SFT 模型生成回答,奖励模型实时打分,通过强化学习算法 PPO (Proximal Policy Optimization) 来更新 SFT 模型的参数,使其生成的回答能获得更高的奖励分。 最终的 RLHF 模型

为什么你已经接触过 DPO?

你之前问的 DPO (Direct Preference Optimization),可以看作是 RLHF 的简化升级版

  • RLHF (PPO路线):需要单独训练一个奖励模型,然后还要跑复杂的强化学习(PPO)流程,训练不稳定,计算量大,门槛高。

  • DPO (直接偏好优化):绕过了“训练奖励模型”和“强化学习”这两个复杂的步骤。它直接用“偏好对”(你喜欢的答案 vs 你不喜欢的答案)数据,通过一种巧妙的数学转换,在一个标准的监督学习框架下,达到和 RLHF 类似的效果。

简单总结:

  • RLHF 是一个流程框架,包含“SFT → 训练RM → PPO”三步。

  • DPO 是一种具体算法,它可以看作是 RLHF 的一种更高效、更稳定的替代实现方案

你目前已经完成了 RLHF 的第一步 (SFT)。接下来,你可以选择:

  • 简单高效的路线:用 DPO 继续优化(推荐)。

  • 完整、极致的路线:如果未来有高质量的人工排序数据和充足的计算资源,可以走 RM → PPO 的完整 RLHF 路线。

RLHF 的本质就是让模型通过“试错”和“人类反馈”,学会更符合我们期望的思维和行为方式。希望这个解释能帮你理清思路!

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐