关于大模型微调后效果,我这里给出可以量化指标

一、用选择题数据集

如:MedQA/CMB

{
  "question": "卧位腰椎穿刺,脑脊液压力正常值是()",
  "options": {
    "A": "190~220mmH2O",
    "B": "80~180mmH2O",
    "C": "50~70mmH2O",
    "D": "230~250mmH2O"
  },
  "answer": "80~180mmH2O",
  "answer_idx": "B",
  "meta_info": "诊断学"
}

做选择题来评估准确率。

二、用开放生成数据集(MedBench、CMB-gen、MORQA、LLMEval-Med)

{
  "question": "患者58岁,突发胸痛2小时,向左臂放射,大汗,呼吸困难,请给出诊断、检查、处理原则",
  "reference_answer": "诊断:急性心肌梗死;检查:心电图、肌钙蛋白、心肌酶;处理:心电监护、吸氧、阿司匹林嚼服、抗凝、必要时PCI",
  "entities": ["急性心肌梗死", "心电图", "肌钙蛋白", "阿司匹林", "抗凝"],
  "hallucination_check": ["禁止编造药名/病名/检查"],
  "source": "临床指南/专家标注"
}
  • 指标:BERTScore、ROUGE-L、医疗实体 F1、幻觉率
  • 目的:考察模型 “生成得好不好、专不专业、有没有瞎编”。

指标含义:

1. ROUGE-L

  • 一句话解释:衡量模型生成内容与标准答案的字词重叠度
  • 评估重点:答案完整性、关键词覆盖率
  • 分数特点:0~1,越高越接近标准答案
  • 通俗理解:模型说的内容和标准答案重合多少

2. BERTScore

  • 一句话解释:基于语义理解的AI 自动相似度打分
  • 评估重点:回答意思是否正确、语义一致性
  • 分数特点:0~1,越高表示语义越匹配
  • 通俗理解:用词不同但意思对,也能得高分

3. 医疗实体 F1

  • 一句话解释:医学关键信息的综合准确率
  • 关注对象:疾病名、药名、检查项目、治疗方案、禁忌症
  • 计算维度:
    • Precision:生成内容里正确的比例
    • Recall:标准答案该说的都覆盖到的比例
    • F1:精确率与召回率的综合得分
  • 通俗理解:医疗核心信息说对多少

4. 幻觉率(Hallucination Rate)

  • 一句话解释:模型瞎编、胡说、虚构内容的概率
  • 统计范围:编造病名/药名/检查、无依据结论、与指南矛盾、虚构数据
  • 计算公式:有幻觉的问题数 / 总问题数
  • 分数特点:越低越好
  • 通俗理解:模型瞎编的概率

指标计算方式(权威流程)

  1. BERTScore / ROUGE-L

    • 以数据集**reference_answer(专家金标准)**为参考
    • 模型生成回答与金标准计算相似度
    • 输出 0~1 分数,越高越贴近标准答案
  2. 医疗实体 F1

    • 数据集提供golden entities(疾病、药物、检查、手术等标准实体)
    • 从模型生成回答中抽取医疗实体
    • 计算精确率、召回率、F1 分数,评估关键信息准确性
  3. 幻觉率

    • 依据数据集标注的事实规范与指南要求
    • 检测生成回答是否存在编造、错误、无依据内容
    • 按条目统计幻觉比例,越低表示模型越可靠
Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐