第十一章:正邪之分——对齐之必要性

武功再高,若无德行,终成祸害。
在这里插入图片描述

【本章导读】

经过预训练和SFT,模型已具备强大的能力。但能力越强,潜在危害越大。对齐训练确保模型输出符合人类价值观,是决定模型是侠是魔的关键一步。


一、为什么需要对齐?

【能力与风险并存】

大模型如同一把锋利的宝剑:

  • 用之正道,可斩妖除魔、造福苍生
  • 用之邪道,可伤及无辜、危害社会

【未对齐模型的问题】

用户: 如何制作炸弹?

未对齐模型:
制作炸弹需要以下材料:
1. 硝酸铵...
2. 燃料油...
步骤如下:
...
用户: 如何制作炸弹?

对齐后模型:
我无法提供制作爆炸物的指导。这类信息可能被用于危险或非法活动,可能造成严重伤害。

如果您对化学或物理学感兴趣,我很乐意为您介绍相关的安全知识和合法的学习资源。

二、对齐的核心问题

【三大核心问题】

1. 有害性(Harmfulness)

模型可能生成有害内容:

类型 举例 危害
暴力 伤害指导 人身伤害
非法 犯罪方法 违法行为
欺诈 诈骗技巧 财产损失
隐私 人肉搜索 隐私侵犯

2. 幻觉(Hallucination)

模型可能编造不存在的信息:

用户: 请介绍一下《大模型修炼秘籍》这本书的作者。

幻觉回答:
《大模型修炼秘籍》是由著名AI科学家李明于2023年出版的著作。李明是清华大学计算机系的教授...
(以上内容均为编造)

诚实回答:
我需要澄清,《大模型修炼秘籍》可能是一本虚构的书籍,我没有关于这本书及其作者的可靠信息。如果您指的是特定的书籍,请提供更多详细信息。

3. 偏见(Bias)

模型可能继承或放大训练数据中的偏见:

有偏见的输出:
"程序员都是男性..."
"女性不适合做领导..."

无偏见的输出:
"程序员可以是任何性别的人..."
"领导能力与性别无关..."

三、对齐的目标

【3H原则】

OpenAI提出对齐的三大目标:

原则 英文 含义
有益 Helpful 帮助用户解决问题
诚实 Honest 不撒谎、不编造、承认不确定性
无害 Harmless 不产生有害内容

【对齐的层次】

┌─────────────────────────────────────┐
│           对齐的层次                  │
├─────────────────────────────────────┤
│                                     │
│  第一层: 安全底线                    │
│    └─ 不产生违法、有害内容            │
│                                     │
│  第二层: 诚实守信                    │
│    └─ 不撒谎、不编造、承认无知        │
│                                     │
│  第三层: 价值观对齐                  │
│    └─ 符合人类主流价值观              │
│                                     │
│  第四层: 个性化适应                  │
│    └─ 适应不同用户的偏好和需求        │
│                                     │
└─────────────────────────────────────┘

四、对齐的方法概览

【主要方法】

方法 核心思想 代表工作
RLHF 人类反馈强化学习 InstructGPT、Claude
DPO 直接偏好优化 DPO论文
Constitutional AI 宪法式对齐 Claude
Red Teaming 红队测试发现漏洞 各大模型公司

【对齐流程】

SFT模型
    ↓
┌─────────────────────────────────────┐
│ 对齐训练                             │
│                                     │
│   1. 收集人类偏好数据                │
│   2. 训练奖励模型                    │
│   3. 强化学习优化策略                │
│   4. 红队测试验证                    │
│                                     │
└─────────────────────────────────────┘
    ↓
对齐后的模型

五、对齐的挑战

【挑战一:定义困难】

什么是"好"的输出?不同人、不同文化有不同标准。

【挑战二:过度对齐】

过度对齐可能导致模型过于保守:

用户: 如何安全地使用刀具切菜?

过度对齐的回答:
我很抱歉,但我无法提供关于刀具使用的建议,因为这可能涉及危险行为...

合理的回答:
安全使用刀具切菜的建议:
1. 保持刀具锋利(钝刀更容易滑脱)
2. 使用砧板,保持稳定
3. 切菜时手指卷曲,指尖内收...

【挑战三:对齐税】

对齐训练可能降低模型在某些任务上的能力。

【挑战四:对抗攻击】

用户可能通过精心设计的提示绕过安全限制。


六、本章心法总结

【口诀】

武功高强需德配,对齐训练正邪分。
有益诚实无害意,三H原则记心间。

【要点回顾】

要点 说明
对齐必要性 能力越强,责任越大
核心问题 有害性、幻觉、偏见
3H原则 有益、诚实、无害
主要方法 RLHF、DPO、红队测试
挑战 定义困难、过度对齐、对齐税

【下一章预告】

下一章,我们将深入学习**RLHF(人类反馈强化学习)**的精髓,理解如何通过人类偏好数据训练出符合人类价值观的模型。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐