Agent 评测集怎么分,实际案例剖析
·
Agent 评测集怎么分,实际案例剖析
0. 核心问题
模型从 72 分涨到 86 分,不能直接得出“模型变好了”。
因为:
分数上涨 != 真实能力上涨
它可能来自:
真实提升 + 数据泄露 + 样本偏差 + 指标投机 + 评分偏差 + 随机波动
所以评测工程师要回答的不是:
分数有没有涨?
而是:
这个提升是否真实、稳定、可上线?
1. 先看分布,不只看平均分
平均分是最粗的指标,容易掩盖问题。
必须检查 3 件事:
1. 哪些场景上涨?
2. 哪些场景下降?
3. 高风险场景是否变差?
例子:
总分:72 -> 86
表达质量:80 -> 95
真实性:90 -> 78
虚构率:3% -> 12%
这种情况下,不能简单认为模型变好了。
因为简历助手里,真实性是硬约束;表达变好但虚构变多,属于质量风险上升。
判定规则:
如果关键安全/真实性指标下降,即使总分上升,也不能直接上线。
2. 集合划分:4 类样本
LLM 产品评测不只是传统的 train / validation / test。
因为我们改的不只是模型参数,还可能在改:
prompt
RAG
Agent 流程
工具调用
产品交互
输出格式
更适合 LLM 产品的划分是:
dev/debug set:开发集
test set:测试集
hidden set:隐藏集
regression set:回归集
对应记忆:
dev/debug:练习题,用来改系统
test:考试卷,用来比版本
hidden:密封卷,用来防刷题
regression:错题本,用来防倒退
各集合的严格定义:
dev/debug set:
允许开发者反复查看。
用于分析 badcase、改 prompt、改流程、改评测规则。
test set:
用于正式比较版本。
不能频繁查看细节,否则会被污染。
hidden set:
开发者平时不可见。
用于判断模型是否对公开测试集过拟合。
regression set:
历史出过问题、已经修复、以后不能复发的样本。
用于防止新版本把旧问题改坏。
一句话:
dev 用来改,test 用来看,hidden 用来防自嗨,regression 用来防倒退。
3. 86 分可能是假的
当分数从 72 到 86,要优先排查 4 类假提升。
3.1 数据泄露
定义:
测试样本被用于 prompt 调优、few-shot 示例、训练数据、规则设计。
结果:
模型不是能力变强,而是见过题。
判定:
如果开发过程反复查看 test case 并据此修改系统,则 test set 已经退化为 dev set。
3.2 样本偏差
定义:
评测样本不能代表真实用户输入。
常见问题:
样本太干净
样本太简单
岗位类型太单一
缺少信息不完整、口语化、表达混乱的输入
判定:
如果评测集没有覆盖真实线上高频场景和高风险场景,分数不能代表线上质量。
3.3 指标投机
定义:
模型学会迎合评分规则,但实际用户价值没有提升。
例子:
答案更长
术语更多
格式更整齐
关键词更多
但真实性下降,用户更难面试自洽
判定:
如果指标上升但关键错误类型增加,属于指标投机。
3.4 回归失败
定义:
新版本修复了新问题,但旧问题复发。
例子:
以前已经修复“不得编造量化数据”
新版本又开始生成原文不存在的增长 30%
判定:
如果 regression set 中出现严重错误,新版本不能直接上线。
4. 把“用户觉得更好”转成指标
“用户觉得更好”不能直接作为评测指标。
它必须拆成可观测变量。
以简历助手为例:
更像我 -> 真实性评分、虚构率
更适合岗位 -> JD 能力覆盖率、岗位匹配度
更专业 -> 表达质量、模板化程度
更有重点 -> 关键信息前置率、核心成果保留率
愿意使用 -> 复制率、保存率、编辑率、重生成率
指标分两类:
离线质量指标:
真实性、岗位匹配、表达质量、成果具体性、可面试性。
线上行为指标:
复制率、保存率、编辑率、重生成率、投诉率。
判断原则:
离线指标回答:答案质量为什么好?
线上指标回答:用户是否真的买账?
完整闭环:
离线评测 + 线上行为 + 人工 badcase 分析
5. 最小上线判定模板
一个版本能不能上线,不看单一总分。
可以用下面的硬规则:
1. 总分提升,并且关键维度不下降。
2. hidden set 结果与 test set 趋势一致。
3. regression set 无严重错误。
4. 高风险场景无明显退化。
5. 线上灰度指标没有恶化。
简历助手可以写成:
总分 >= 目标阈值
真实性 >= 目标阈值
严重虚构数 = 0
regression set 通过率 = 100%
hidden set 无明显掉分
线上投诉率不上升
6. 最终记忆版
LLM 评测集不是只分 train、validation、test。
更实用的是 4 类:
dev/debug:练习题
test:考试卷
hidden:密封卷
regression:错题本
分数上涨后,必须检查:
1. 是否只看平均分?
2. 是否发生数据泄露?
3. 样本是否代表真实用户?
4. hidden set 是否还能通过?
5. regression set 是否有旧问题复发?
6. 线上用户行为是否真的变好?
评测工程师的价值不是报告:
模型分数涨了。
而是证明:
这个提升是真的。
这个版本能上线。
这个问题知道该怎么改。
更多推荐


所有评论(0)