大模型---模型的后训练
目录
这篇文章会讲三种不同的后训练方式:继续训练,SFT,对齐训练,这里先总体说一下。Don't Stop Pretraining把继续训练定义为多阶段自适应预训练,并证明在目标领域语料和任务相关无标注语料上继续预训练,通常能提升下游表现;SFT在对齐训练之前,即让模型先学会按指令做答;对齐训练则是进一步把偏好对齐写成更直接的偏好优化目标。
1.继续训练
继续训练解决的问题是模型不熟这个行业的术语,模型不熟这类文档的表达方式,模型面对目标领域语料时理解不够自然,或者下游任务的文本分布和通用预训练差异太大。
参考论文:[2004.10964] Don't Stop Pretraining: Adapt Language Models to Domains and Tasks
Don't Stop Pretraining这篇论文,讲到两个,一是DAPT(Domain-Adaptive Pretraining),二是TAPT(Task-Adaptive Pretraining)。DAPT是在一个更大的、同领域语料库上继续预训练。比如医学、法律、金融、科研论文;TAPT是在与你最终任务更贴近的无标注语料上继续预训练。比如某个分类任务对应的数据集文本本身。
继续训练的优缺点:能让模型更自然地理解领域术语,更好地建模领域文本中的共现关系,更适应目标任务文本风格。但是成本通常比SFT高;且需要大量高质量无标注语料;如果语料质量差,可能把模型带偏;如果训练策略不好,可能出现遗忘或风格漂移。
2.SFT
SFT则是让模型更会按指令回答,按指定格式输出,学会特定任务流程,保持稳定的回答风格。其实SFT也可以注入知识,但是通常是窄范围、任务绑定式的。比如用很多高质量问答样本做SFT,模型会更会回答这批问题,也可能记住其中一部分知识点;但如果你的目标是“让模型整体更懂法律文书、医学论文、金融公告的语言和分布”,那通常还是继续训练更合适。
3.对齐训练
对齐训练解决的是回答是否更有帮助,是否更少胡编,是否更符合用户偏好和产品规范。最典型的是RLHF,InstructGPT明确说,单纯做next-token prediction并不会天然让模型更好地遵循用户意图,因此他们采用 RLHF。InstructGPT的训练流程一般是先收集标注员写的示范答案,做监督微调,也就是上面说的SFT,让模型先具备“按用户意图作答”的基础能力,然后再进入偏好对齐阶段。关于RLHF可以看这篇博客进行更深入地了解:
更多推荐
所有评论(0)