主要任务:

学习并完成大模型微调部分的功能

工作过程记录:

1、什么是大模型微调 ?

微调(Fine-tuning)大模型,通俗来讲,就是给一个“博览群书”的基础大模型(预训练完成,已掌握通用语言规律和基础世界知识),做一次“针对性专业特训”。我们可以把预训练大模型理解为一个“全才”,什么都懂一点,但面对医疗、法律、企业内部业务等特定领域的专业需求时,就显得不够“精通”,甚至会出现答非所问、不懂行业黑话的情况。微调的核心,就是用少量、高质量的领域专属数据,在基础大模型的基础上继续训练,让模型聚焦某个垂直领域深耕细作,从“样样通、样样松”的全才,蜕变为“术业有专攻”的领域专才。

LoRA微调核心原理,本质是在大模型权重文件的输出环节,额外添加一个可训练的低秩矩阵,无需改动原始模型权重

1.微调前置:数据集准备

1)知识文档转为Markdown

  • 《中华人民共和国道路交通安全法》
  • 《中华人民共和国道路交通安全法实施条例》
  • 《机动车驾驶证申领和使用规定》
  • 《道路交通安全违法行为记分管理办法》
  • 《道路交通安全违法行为处理程序规定》
  • 《机动车登记规定》
  • 交通标志标线相关标准文件,如 GB 5768 系列
  • 各地交管部门发布的考试规则、处罚细则、业务办理说明
  • 科目一完整题库
  • 科目四完整题库
  • 每道题的题干、选项、标准答案、官方解析
  • 驾考理论教材
  • 科目一/科目四知识点总结
  • 交通安全常识讲义
  • 驾驶行为规范讲解文档
  • 重点难点知识整理

2)构建微调数据集:

{拿到统一格式的Markdown文档后,还不能直接用来微调——大模型微调的核心是“问答式训练”,也就是说,我们需要将Markdown文档中的知识点,转化为“一问一答”的形式(即问答对),模型才能通过这些问答对,学习领域知识。}

借助开源工具Easy-dataset;工具地址:easy-dataset/README.zh-CN.md

前置准备:使用Easy-dataset前,需要本地部署一个基础大模型,用于自动生成问答对。

使用Ollama部署Qwen2.5-7B模型

2、核心操作:大模型微调实操

LLaMA Factory尝试在山东大学高性能计算平台操作

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐