Achiam J, Adler S, Agarwal S, et al. Gpt-4 technical report[J]. arXiv preprint arXiv:2303.08774, 2023.

可预测的扩展

由于像GPT-4这样的大规模训练运行成本极高,无法进行广泛的模型特定调整,因此OpenAI致力于构建一个表现可预测的深度学习堆栈。这使得团队能够通过使用计算量仅为GPT-4 1/1,000到1/10,000的小型模型,可靠地预测GPT-4的某些性能。

在损失预测方面,OpenAI通过拟合一个包含不可约损失项的缩放定律L(C)=a\tilde{C}^{b}+c来预测GPT-4在内部代码库(不包含在训练集中)上的最终损失,这一预测是基于使用相同方法训练的模型得出的,这些模型的计算量最多仅为GPT-4的1/10,000。图中显示了较小模型(灰点)的损失随计算量变化的趋势,以及拟合的幂律曲线(虚线),该曲线非常准确地预测了GPT-4的最终损失(图中的绿点),验证了优化基础设施的可扩展性。

在能力扩展方面,主要使用的指标是HumanEval数据集上的通过率,该数据集衡量模型合成不同复杂度Python函数的能力。团队发现可以通过近似的幂律关系-E_{P}[log(pass\_rate(C))]=\alpha*C^{-k}来预测性能,图片展示了基于计算量最多减少1,000倍的模型进行的预测。图中虚线(基于小模型的拟合)准确预测了GPT-4(绿点)在HumanEval子集上的性能。

风险与缓解措施

GPT-4的能力提升带来了新的风险面。为了解这些风险,OpenAI聘请了50多位来自不同领域的专家(包括长期AI对齐风险、网络安全、生物风险和国际安全等)对模型进行对抗性测试(红队),专家的发现帮助测试了高风险领域的模型行为,这些领域通常需要特定的专业知识才能评估。专家的数据被用于改进模型的能力,例如拒绝合成危险化学品的请求。

除了使用人类反馈强化学习(RLHF)来微调模型外,OpenAI还引入了基于规则的奖励模型(RBRMs),RBRMs是一组零样本的GPT-4分类器。它们根据人类编写的规则对策略模型的输出进行分类(例如:拒绝是否符合期望风格、是否包含禁止内容等)。这些分类器在RLHF微调期间为GPT-4提供额外的奖励信号,从而引导模型拒绝有害请求或不拒绝无害请求。

附录

RLHF(基于人类反馈的强化学习)并没有显著提高(甚至可能略微降低)基础模型的原始能力。OpenAI 对比了 Base 模型和 RLHF 模型在多项考试中的表现。结果显示,Base 模型的平均得分为 73.7%,而 RLHF 模型为 74.0%,两者基本持平。模型在考试中的优异表现主要源于预训练阶段,而非后期的 RLHF。这意味着如果您想让模型变“聪明”,重点在于预训练数据质量;RLHF 更多是为了让模型“听话”和符合安全规范。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐