AI核心知识20——大语言模型之RLHF(简洁且通俗易懂版)
RLHF(Reinforcement Learning from Human Feedback)的全称是 “基于人类反馈的强化学习”。
它是大语言模型训练的第三阶段,也是目前让 AI 变得真正“好用”和“安全”的一个核心。
如果说:
-
预训练是 “读万卷书”(获得知识);
-
监督微调 (SFT) 是 “老师教学”(学会回答);
-
那么 RLHF 就是 “道德与价值观的对齐”,就像是把一个刚毕业的学生培养成一个符合社会规范、情商高、价值观正的优秀员工。
1. 💡 为什么要进行 RLHF?SFT 不够吗?
经过监督微调(SFT)的模型虽然能回答问题,但它往往面临两个问题:
-
不知道哪个答案“更好”:对于同一个问题,AI 可以生成 10 种不同的回答。有的幽默,有的严肃,有的可能包含有害信息。SFT 模型不知道人类更喜欢哪一种。
-
安全隐患:如果用户问“如何制造毒药?”,SFT 模型可能会老老实实地给出配方(因为它学会了听指令)。这很危险。
RLHF 的目标就是:让 AI 的回答符合人类的价值观(有用、诚实、无害)。
2. 🛠️ RLHF 是怎么做的?(三步走)
这个过程不像 SFT 那样让人类写答案,而是让人类做裁判。
第一步:人类排名(收集偏好数据)
让模型针对同一个问题生成几个不同的回答(比如 A 和 B)。
然后,让人类标注员来评判:“我觉得 A 比 B 好”。
-
标准通常是:A 更得体、更安全、逻辑更清晰。
第二步:训练奖励模型(Reward Model)
我们不可能一直让人类盯着 AI 看。所以,科学家利用上面的数据,训练了一个小一点的 AI 模型,叫 “奖励模型”。
这个奖励模型学会了人类的口味。它的工作就是:看到一个回答,就给它打分。
第三步:强化学习(PPO 算法)
这是最后一步。让大模型不断生成回答:
-
如果生成的回答,奖励模型给分高 $\rightarrow$ 大模型受到**“奖励”**(参数调整,以后多这么干)。
-
如果生成的回答,奖励模型给分低(比如这就是个有毒的建议)$\rightarrow$ 大模型受到**“惩罚”**(参数调整,以后少这么干)。
3. 🐕 形象的比喻:驯狗
为了让你秒懂 RLHF,我们可以把它比作训练狗狗:
-
SFT(监督微调):你教狗狗听到“坐下”这个指令时,屁股要着地。它学会了动作。
-
RLHF(强化学习):
-
有时候狗狗坐得很快,你给它一块饼干(奖励)。
-
有时候狗狗一边坐一边乱叫,你不给饼干,甚至训斥它(惩罚)。
-
久而久之,狗狗不仅学会了“坐下”,还学会了**“安静且快速地坐下”**,这才是你真正想要的。
-
RLHF 中的“饼干”,就是奖励模型的打分。
4. 🏆 RLHF 带来了什么效果?
正是因为有了 RLHF,现在的 ChatGPT、Claude 等模型才能做到:
-
拒绝回答有害问题:问它“怎么抢银行”,它会说“我不能提供帮助”。
-
更有助益:回答更详尽、语气更友善。
-
减少幻觉:虽然不能完全消除,但比纯基座模型要严谨得多。
🏁 大模型训练全流程总结
现在你已经掌握了 LLM 诞生的完整三部曲:
| 阶段 | 英文缩写 | 核心动作 | 类比 | 产出 |
| 1. 预训练 | Pre-training | 预测下一个词 | 通识教育 (读书) | 基座模型 (Base) |
| 2. 监督微调 | SFT | 模仿人类问答 | 岗位培训 (上课) | 对话模型 (Chat) |
| 3. 强化学习 | RLHF | 根据打分优化 | 绩效考核 (奖惩) | 对齐的模型 (Aligned) |
一句话总结: RLHF 就是通过奖惩机制,把 AI 的行为“对齐”到人类的价值观上,让它不仅能干活,还能干得让人感到满意。
更多推荐



所有评论(0)