RLHF(Reinforcement Learning from Human Feedback)的全称是 “基于人类反馈的强化学习”

它是大语言模型训练的第三阶段,也是目前让 AI 变得真正“好用”和“安全”的一个核心

如果说:

  • 预训练“读万卷书”(获得知识);

  • 监督微调 (SFT)“老师教学”(学会回答);

  • 那么 RLHF 就是 “道德与价值观的对齐”,就像是把一个刚毕业的学生培养成一个符合社会规范、情商高、价值观正的优秀员工。


1. 💡 为什么要进行 RLHF?SFT 不够吗?

经过监督微调(SFT)的模型虽然能回答问题,但它往往面临两个问题:

  1. 不知道哪个答案“更好”:对于同一个问题,AI 可以生成 10 种不同的回答。有的幽默,有的严肃,有的可能包含有害信息。SFT 模型不知道人类更喜欢哪一种。

  2. 安全隐患:如果用户问“如何制造毒药?”,SFT 模型可能会老老实实地给出配方(因为它学会了听指令)。这很危险。

RLHF 的目标就是:让 AI 的回答符合人类的价值观(有用、诚实、无害)。


2. 🛠️ RLHF 是怎么做的?(三步走)

这个过程不像 SFT 那样让人类写答案,而是让人类做裁判

第一步:人类排名(收集偏好数据)

让模型针对同一个问题生成几个不同的回答(比如 A 和 B)。

然后,让人类标注员来评判:“我觉得 A 比 B 好”。

  • 标准通常是:A 更得体、更安全、逻辑更清晰。

第二步:训练奖励模型(Reward Model)

我们不可能一直让人类盯着 AI 看。所以,科学家利用上面的数据,训练了一个小一点的 AI 模型,叫 “奖励模型”。

这个奖励模型学会了人类的口味。它的工作就是:看到一个回答,就给它打分。

第三步:强化学习(PPO 算法)

这是最后一步。让大模型不断生成回答:

  • 如果生成的回答,奖励模型给分 $\rightarrow$ 大模型受到**“奖励”**(参数调整,以后多这么干)。

  • 如果生成的回答,奖励模型给分(比如这就是个有毒的建议)$\rightarrow$ 大模型受到**“惩罚”**(参数调整,以后少这么干)。


3. 🐕 形象的比喻:驯狗

为了让你秒懂 RLHF,我们可以把它比作训练狗狗

  • SFT(监督微调):你教狗狗听到“坐下”这个指令时,屁股要着地。它学会了动作。

  • RLHF(强化学习)

    • 有时候狗狗坐得很快,你给它一块饼干(奖励)

    • 有时候狗狗一边坐一边乱叫,你不给饼干,甚至训斥它(惩罚)

    • 久而久之,狗狗不仅学会了“坐下”,还学会了**“安静且快速地坐下”**,这才是你真正想要的。

RLHF 中的“饼干”,就是奖励模型的打分。


4. 🏆 RLHF 带来了什么效果?

正是因为有了 RLHF,现在的 ChatGPT、Claude 等模型才能做到:

  1. 拒绝回答有害问题:问它“怎么抢银行”,它会说“我不能提供帮助”。

  2. 更有助益:回答更详尽、语气更友善。

  3. 减少幻觉:虽然不能完全消除,但比纯基座模型要严谨得多。


🏁 大模型训练全流程总结

现在你已经掌握了 LLM 诞生的完整三部曲:

阶段 英文缩写 核心动作 类比 产出
1. 预训练 Pre-training 预测下一个词 通识教育 (读书) 基座模型 (Base)
2. 监督微调 SFT 模仿人类问答 岗位培训 (上课) 对话模型 (Chat)
3. 强化学习 RLHF 根据打分优化 绩效考核 (奖惩) 对齐的模型 (Aligned)

一句话总结: RLHF 就是通过奖惩机制,把 AI 的行为“对齐”到人类的价值观上,让它不仅能干活,还能干得让人感到满意。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐