怎么评价大模型微调前后的效果
·
文章目录
关于大模型微调后效果,我这里给出可以量化指标
一、用选择题数据集
如:MedQA/CMB
{
"question": "卧位腰椎穿刺,脑脊液压力正常值是()",
"options": {
"A": "190~220mmH2O",
"B": "80~180mmH2O",
"C": "50~70mmH2O",
"D": "230~250mmH2O"
},
"answer": "80~180mmH2O",
"answer_idx": "B",
"meta_info": "诊断学"
}
做选择题来评估准确率。
二、用开放生成数据集(MedBench、CMB-gen、MORQA、LLMEval-Med)
{
"question": "患者58岁,突发胸痛2小时,向左臂放射,大汗,呼吸困难,请给出诊断、检查、处理原则",
"reference_answer": "诊断:急性心肌梗死;检查:心电图、肌钙蛋白、心肌酶;处理:心电监护、吸氧、阿司匹林嚼服、抗凝、必要时PCI",
"entities": ["急性心肌梗死", "心电图", "肌钙蛋白", "阿司匹林", "抗凝"],
"hallucination_check": ["禁止编造药名/病名/检查"],
"source": "临床指南/专家标注"
}
- 指标:BERTScore、ROUGE-L、医疗实体 F1、幻觉率
- 目的:考察模型 “生成得好不好、专不专业、有没有瞎编”。
指标含义:
1. ROUGE-L
- 一句话解释:衡量模型生成内容与标准答案的字词重叠度
- 评估重点:答案完整性、关键词覆盖率
- 分数特点:0~1,越高越接近标准答案
- 通俗理解:模型说的内容和标准答案重合多少
2. BERTScore
- 一句话解释:基于语义理解的AI 自动相似度打分
- 评估重点:回答意思是否正确、语义一致性
- 分数特点:0~1,越高表示语义越匹配
- 通俗理解:用词不同但意思对,也能得高分
3. 医疗实体 F1
- 一句话解释:医学关键信息的综合准确率
- 关注对象:疾病名、药名、检查项目、治疗方案、禁忌症
- 计算维度:
- Precision:生成内容里正确的比例
- Recall:标准答案该说的都覆盖到的比例
- F1:精确率与召回率的综合得分
- 通俗理解:医疗核心信息说对多少
4. 幻觉率(Hallucination Rate)
- 一句话解释:模型瞎编、胡说、虚构内容的概率
- 统计范围:编造病名/药名/检查、无依据结论、与指南矛盾、虚构数据
- 计算公式:有幻觉的问题数 / 总问题数
- 分数特点:越低越好
- 通俗理解:模型瞎编的概率
指标计算方式(权威流程)
-
BERTScore / ROUGE-L
- 以数据集**reference_answer(专家金标准)**为参考
- 模型生成回答与金标准计算相似度
- 输出 0~1 分数,越高越贴近标准答案
-
医疗实体 F1
- 数据集提供golden entities(疾病、药物、检查、手术等标准实体)
- 从模型生成回答中抽取医疗实体
- 计算精确率、召回率、F1 分数,评估关键信息准确性
-
幻觉率
- 依据数据集标注的事实规范与指南要求
- 检测生成回答是否存在编造、错误、无依据内容
- 按条目统计幻觉比例,越低表示模型越可靠
更多推荐


所有评论(0)