Agent 评测集怎么分,实际案例剖析

0. 核心问题

模型从 72 分涨到 86 分,不能直接得出“模型变好了”。

因为:

分数上涨 != 真实能力上涨

它可能来自:

真实提升 + 数据泄露 + 样本偏差 + 指标投机 + 评分偏差 + 随机波动

所以评测工程师要回答的不是:

分数有没有涨?

而是:

这个提升是否真实、稳定、可上线?

1. 先看分布,不只看平均分

平均分是最粗的指标,容易掩盖问题。

必须检查 3 件事:

1. 哪些场景上涨?
2. 哪些场景下降?
3. 高风险场景是否变差?

例子:

总分:72 -> 86
表达质量:80 -> 95
真实性:90 -> 78
虚构率:3% -> 12%

这种情况下,不能简单认为模型变好了。

因为简历助手里,真实性是硬约束;表达变好但虚构变多,属于质量风险上升。

判定规则:

如果关键安全/真实性指标下降,即使总分上升,也不能直接上线。

2. 集合划分:4 类样本

LLM 产品评测不只是传统的 train / validation / test。

因为我们改的不只是模型参数,还可能在改:

prompt
RAG
Agent 流程
工具调用
产品交互
输出格式

更适合 LLM 产品的划分是:

dev/debug set:开发集
test set:测试集
hidden set:隐藏集
regression set:回归集

对应记忆:

dev/debug:练习题,用来改系统
test:考试卷,用来比版本
hidden:密封卷,用来防刷题
regression:错题本,用来防倒退

各集合的严格定义:

dev/debug set:
允许开发者反复查看。
用于分析 badcase、改 prompt、改流程、改评测规则。

test set:
用于正式比较版本。
不能频繁查看细节,否则会被污染。

hidden set:
开发者平时不可见。
用于判断模型是否对公开测试集过拟合。

regression set:
历史出过问题、已经修复、以后不能复发的样本。
用于防止新版本把旧问题改坏。

一句话:

dev 用来改,test 用来看,hidden 用来防自嗨,regression 用来防倒退。

3. 86 分可能是假的

当分数从 72 到 86,要优先排查 4 类假提升。

3.1 数据泄露

定义:

测试样本被用于 prompt 调优、few-shot 示例、训练数据、规则设计。

结果:

模型不是能力变强,而是见过题。

判定:

如果开发过程反复查看 test case 并据此修改系统,则 test set 已经退化为 dev set。

3.2 样本偏差

定义:

评测样本不能代表真实用户输入。

常见问题:

样本太干净
样本太简单
岗位类型太单一
缺少信息不完整、口语化、表达混乱的输入

判定:

如果评测集没有覆盖真实线上高频场景和高风险场景,分数不能代表线上质量。

3.3 指标投机

定义:

模型学会迎合评分规则,但实际用户价值没有提升。

例子:

答案更长
术语更多
格式更整齐
关键词更多
但真实性下降,用户更难面试自洽

判定:

如果指标上升但关键错误类型增加,属于指标投机。

3.4 回归失败

定义:

新版本修复了新问题,但旧问题复发。

例子:

以前已经修复“不得编造量化数据”
新版本又开始生成原文不存在的增长 30%

判定:

如果 regression set 中出现严重错误,新版本不能直接上线。

4. 把“用户觉得更好”转成指标

“用户觉得更好”不能直接作为评测指标。

它必须拆成可观测变量。

以简历助手为例:

更像我 -> 真实性评分、虚构率
更适合岗位 -> JD 能力覆盖率、岗位匹配度
更专业 -> 表达质量、模板化程度
更有重点 -> 关键信息前置率、核心成果保留率
愿意使用 -> 复制率、保存率、编辑率、重生成率

指标分两类:

离线质量指标:
真实性、岗位匹配、表达质量、成果具体性、可面试性。

线上行为指标:
复制率、保存率、编辑率、重生成率、投诉率。

判断原则:

离线指标回答:答案质量为什么好?
线上指标回答:用户是否真的买账?

完整闭环:

离线评测 + 线上行为 + 人工 badcase 分析

5. 最小上线判定模板

一个版本能不能上线,不看单一总分。

可以用下面的硬规则:

1. 总分提升,并且关键维度不下降。
2. hidden set 结果与 test set 趋势一致。
3. regression set 无严重错误。
4. 高风险场景无明显退化。
5. 线上灰度指标没有恶化。

简历助手可以写成:

总分 >= 目标阈值
真实性 >= 目标阈值
严重虚构数 = 0
regression set 通过率 = 100%
hidden set 无明显掉分
线上投诉率不上升

6. 最终记忆版

LLM 评测集不是只分 train、validation、test。

更实用的是 4 类:

dev/debug:练习题
test:考试卷
hidden:密封卷
regression:错题本

分数上涨后,必须检查:

1. 是否只看平均分?
2. 是否发生数据泄露?
3. 样本是否代表真实用户?
4. hidden set 是否还能通过?
5. regression set 是否有旧问题复发?
6. 线上用户行为是否真的变好?

评测工程师的价值不是报告:

模型分数涨了。

而是证明:

这个提升是真的。
这个版本能上线。
这个问题知道该怎么改。
Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐