NLP/机器学习评价实验可复现性如何“量化评估”*?
这篇论文 《Quantified Reproducibility Assessment for Four Common Types of Evaluation Results in NLP/ML》https://direct.mit.edu/coli/article/doi/10.1162/COLI.a.625/136454/Quantified-Reproducibility-Assessment-for-Four 可以理解为一篇关于 NLP/机器学习评价实验可复现性如何“量化评估” 的方法论文。它发表在 Computational Linguistics,作者是 Anya Belz 和 Craig Thomson。这篇文章的问题意识很明确:NLP/ML 领域已经有很多复现实验,但大家常常只是说“复现成功”或“复现失败”,缺少一个可以跨研究比较的、连续数值化的评估框架。作者提出的 QRA:Quantified Reproducibility Assessment,就是为了解决这个问题。
简单说,这篇文章不是在问“某个 NLP 模型能不能复现”,而是在问:
如果多个研究团队重复同一个或相似的评价实验,我们应该如何定量判断它们复现得有多好?
一、论文核心问题:NLP/ML 的“复现性”不能只用成功/失败来判断
文章开头指出,NLP/ML 领域已经积累了大量复现实验结果。例如,有些研究团队重复别人的评价实验,有些研究团队为了公平比较新系统和旧系统,也会重新跑已有系统的评价。Belz 等人此前收集过大量“原始结果—复现结果”的成对分数,ReproNLP 等共享任务也产生了很多复现数据。
这些研究共同揭示了一个令人担忧的事实:
即使是自动评价指标,重复评价也很少得到完全相同的分数。
但问题在于,以往研究的结论大多是定性的、叙述性的。例如:
- 复现成功;
- 复现失败;
- 结果大致一致;
- 排名有所不同;
- 结论不稳定。
这些说法的问题是:标准不统一,也不可比较。一篇论文说“复现较好”,另一篇论文说“复现一般”,但它们的判断依据可能完全不同。
因此,作者认为,NLP/ML 领域需要一个更坚实的量化基础,用来回答:
- 单个系统分数复现得如何?
- 多个系统的整体分数关系复现得如何?
- 系统排名是否复现?
- 论文中的核心发现是否复现?
- 哪些实验条件改变会导致复现性变差?
- 人工评价和自动评价的复现性是否不同?
- 不同质量维度,例如 fluency、overall quality、acceptability,复现性是否不同?
这正是 QRA 框架要解决的问题。
二、作者如何定义“可复现性”:从计量学出发
这篇论文有一个重要特点:它没有重新发明一套 NLP 专属的“复现性”概念,而是回到 计量学 metrology 的定义。
作者引用了 International Vocabulary of Metrology,简称 VIM,对 repeatability 和 reproducibility 的定义。
在计量学中:
- repeatability 通常指在相同测量条件下重复测量的精密度;
- reproducibility 指在不同测量条件下重复测量的精密度。
作者将这个思想迁移到 NLP/ML 评价实验中。
在 NLP/ML 语境下,对应关系大致是:
| 计量学概念 | NLP/ML 中的对应概念 |
|---|---|
| measurement 测量 | evaluation experiment 评价实验 |
| object 测量对象 | system 系统/模型 |
| measurand 被测量量 | evaluation measure 评价指标或质量标准 |
| measured value 测量值 | evaluation result 评价结果 |
| measurement conditions 测量条件 | experiment properties 实验属性 |
也就是说,一个 NLP 评价实验其实可以被看成一种“测量”活动:我们用某个评价指标,在某组实验条件下,对某个系统进行测量,然后得到一个分数。
作者用公式表达为:
R(M1,M2,...,Mn):=Precision(v1,v2,...,vn) R(M_1, M_2, ..., M_n) := Precision(v_1, v_2, ..., v_n) R(M1,M2,...,Mn):=Precision(v1,v2,...,vn)
其中,每次测量可以表示为:
Mi:(m,O,ti,Ci)↦vi M_i : (m, O, t_i, C_i) \mapsto v_i Mi:(m,O,ti,Ci)↦vi
这里:
- mmm 是评价指标或质量标准;
- OOO 是被评价的系统;
- tit_iti 是测量时间;
- CiC_iCi 是实验条件;
- viv_ivi 是得到的评价结果;
- RRR 表示复现性或重复性;
- PrecisionPrecisionPrecision 表示这些评价值之间的一致程度。
这个定义的关键在于:
复现性不是一个抽象判断,而是多个评价结果之间的精密度。
这也是 QRA 能够量化复现性的理论基础。
三、QRA 框架的基本目标
作者认为,一个好的复现性评估框架至少要满足五个要求。
第一,它必须基于实验属性的相似性。也就是说,如果两个实验的测试集、指标实现、评价者、运行环境等都一样,我们应该期待它们结果更接近;如果这些属性不同,那么结果不同本身就是可以预期的。
第二,它要支持多个粒度的评估。因为即使两个系统的具体分数不同,系统排名或研究结论可能仍然一致。例如,原始实验中 A 比 B 好,复现实验中 A 还是比 B 好,那么核心发现可能是可复现的。
第三,它不能只处理两个实验之间的比较,还要支持 n≥2n \geq 2n≥2 个实验的比较。因为只比较一次原始实验和一次复现实验,有时会很偶然;多个复现实验能给出更稳定的复现性判断。
第四,它要能处理不同类型的评价结果。NLP/ML 研究中的结果不只有数值分数,也有分类标签、系统排名、论文发现等。
第五,它应该产生连续值,而不是简单的二元判断。也就是说,复现性应该是“程度问题”,而不是只有成功/失败。
四、QRA 的四个组成部分
QRA 框架主要由四部分构成:
- 实验属性 experiment properties
- 四类评价结果 result types
- 对应的复现性度量 measures
- 统一的报告模板 reporting template
其中最重要的是前面三部分。
五、实验属性:为什么“相似实验”才应该有高复现性?
论文列出了 22 个实验属性,其中 19 个来自 HEDS 3.0,另外 3 个是作者额外加入的属性。
这些属性包括:
- 评价指标;
- 指标实现;
- 运行时环境;
- 输入类型;
- 输出类型;
- 任务类型;
- 测试数据集;
- 被评价项目数量;
- 客观评价还是主观评价;
- 绝对评价还是相对评价;
- 内在评价还是外在评价。
如果是人工评价,还包括:
- 评价者数量;
- 评价者专业背景;
- 作者是否参与评价;
- 评价者是否接受训练;
- 评价者类型;
- 评价工具或平台;
- 质量控制方法;
- 质量标准是否标准化;
- 评分工具类型;
- 评价问题或提示词;
- 回答 elicitation 形式。
这些属性的意义在于,作者希望建立一个判断基础:
实验越相似,理论上应该越容易复现;实验越不同,结果出现差异越不意外。
这点很重要。因为很多复现研究只说结果不一样,却没有系统说明到底哪些实验条件变了。QRA 通过实验属性表,使得研究者可以进一步分析:
- 是测试集变化导致结果不同?
- 是随机种子不同导致结果不同?
- 是指标实现不同导致结果不同?
- 是运行环境不同导致结果不同?
- 是评价者群体不同导致人工评价不稳定?
这就把“复现失败”从一个笼统结论变成了可诊断的问题。
六、QRA 区分四类评价结果
这篇文章的一个关键贡献是,它将 NLP/ML 论文中常见的评价结果分成四种类型。
Type I:单个数值分数
例如:
- BLEU 分数;
- 平均人工评分;
- 错误数量;
- F1 分数;
- accuracy;
- 某个系统在某个指标上的一个结果。
这类结果关注的是:
同一个系统,在多个实验中得到的具体分数是否接近?
例如,原始实验中某模型 BLEU 是 35.2,复现实验中是 34.9,那么分数很接近;如果复现实验中变成 25.0,则复现性较差。
Type II:一组相关数值分数
例如多个系统在同一任务、同一指标上的分数集合:
| 系统 | 原始实验 BLEU | 复现实验 BLEU |
|---|---|---|
| A | 35 | 34 |
| B | 32 | 31 |
| C | 28 | 27 |
这里关注的不是单个分数,而是:
多个系统之间的整体分数关系是否保持一致?
即使所有分数都下降了,只要 A、B、C 的相对关系保持一致,那么 Type II 复现性可能仍然很好。
Type III:文本片段上的分类标签
例如:
- 翻译错误标注;
- 情感类别标注;
- 语法错误标签;
- 文本片段的修辞功能标签;
- 数据项级别的分类标签。
这类结果关注的是:
不同实验中,对相同文本或文本片段打出的标签是否一致?
作者将这类问题类比为标注者一致性问题,因此使用 Cohen’s kappa、Krippendorff’s alpha 等一致性指标。
Type IV:关于系统差异的研究发现
这是作者认为非常重要的一类结果。很多 NLP/ML 研究真正关心的不是具体分数,而是类似这样的发现:
- 系统 A 优于系统 B;
- 新模型比 baseline 更好;
- 某种方法在某个质量维度上表现更优;
- 某个消融组件提升了性能。
这种结果关注的是:
原始实验得出的系统比较结论,在复现实验中是否仍然成立?
例如,即使原始实验和复现实验的具体 BLEU 分数不同,但如果两者都显示 A 优于 B,那么核心发现就可能是可复现的。
七、不同结果类型对应不同复现性指标
QRA 的方法设计很清楚:不同类型的结果不能用同一个指标来判断复现性。
论文给出的对应关系大致如下。
| 结果类型 | 内容 | 主要复现性指标 |
|---|---|---|
| Type I | 单个数值分数 | CV∗CV^*CV∗ |
| Type II | 一组数值分数 | Pearson’s rrr、Spearman’s ρ\rhoρ、Kendall’s τ\tauτ、Kendall’s WWW |
| Type III | 分类标签 | Cohen’s κ\kappaκ、Krippendorff’s α\alphaα |
| Type IV | 系统差异/排名发现 | PPP,即相同成对排名比例 |
其中,Type I 的 CV∗CV^*CV∗ 和 Type IV 的 PPP 是文章中特别值得关注的两个指标。
八、Type I:用修正后的变异系数 CV∗CV^*CV∗ 衡量分数复现性
对于单个数值分数,作者使用 coefficient of variation 变异系数 的思想。
普通变异系数是标准差除以均值:
CV=sm CV = \frac{s}{m} CV=ms
但 NLP/ML 复现实验通常样本量很小,例如只有原始实验和一次复现实验,即 n=2n = 2n=2。在小样本情况下,普通标准差有偏,因此作者使用无偏标准差估计 s∗s^*s∗,进而得到:
CV∗=s∗∣m∣ CV^* = \frac{s^*}{|m|} CV∗=∣m∣s∗
其中:
s∗=cns s^* = c_n s s∗=cns
修正因子为:
cn=n−12Γ(n−12)Γ(n2) c_n = \sqrt{\frac{n - 1}{2}} \frac{\Gamma(\frac{n - 1}{2})}{\Gamma(\frac{n}{2})} cn=2n−1Γ(2n)Γ(2n−1)
这个指标的直觉很简单:
多个实验中,同一系统的分数越接近,标准差越小,CV∗CV^*CV∗ 越小,复现性越好。
作者还给出了大致解释标准。对于人工评价:
- good:[0,10][0, 10][0,10]
- medium:(10,30](10, 30](10,30]
- poor:(30,∞)(30, \infty)(30,∞)
对于自动指标:
- good:[0,1][0, 1][0,1]
- medium:(1,5](1, 5](1,5]
- poor:(5,∞)(5, \infty)(5,∞)
这里要注意,自动指标的标准更严格,因为理论上自动指标如果实验条件完全一致,应该更容易得到接近结果。
九、Type II:用相关系数衡量一组系统分数的复现性
对于一组系统分数,作者使用相关系数:
- Pearson’s rrr:衡量线性相关;
- Spearman’s ρ\rhoρ:衡量等级相关;
- Kendall’s τ\tauτ:衡量排序一致性;
- Kendall’s WWW:用于多个实验时的一致性度量。
这里的重点是:
Type II 不关心每个系统的绝对分数是否完全一样,而关心多个系统之间的分数结构是否一致。
例如,三个系统的分数都整体下降,但排序和相对关系保持一致,那么相关系数可能仍然很高。
这也解释了为什么有些实验的单个分数复现性一般,但系统比较结论仍然非常稳定。
十、Type III:用一致性指标衡量标签复现性
对于分类标签,作者使用类似人工标注一致性的指标。
当只有两个实验时,使用 Cohen’s κ\kappaκ。
当有多个实验时,使用 Krippendorff’s α\alphaα。
这类指标适合评估:
- 错误类型标注是否复现;
- 文本片段分类是否复现;
- 数据项标签是否复现;
- 人工评价中的未聚合标签是否复现。
值得注意的是,作者说,如果这些标签已经被聚合成系统级分数,例如错误数量或平均评分,那么它们就转化成了 Type I 结果,应使用 CV∗CV^*CV∗ 来评估。
十一、Type IV:用 PPP 衡量研究发现和系统排名是否复现
Type IV 是这篇文章中很有启发性的部分。作者提出用 PPP 表示不同实验中 相同成对系统排名的比例。
简单说,如果有三个系统 A、B、C,那么可以比较:
- A 是否优于 B;
- A 是否优于 C;
- B 是否优于 C。
如果原始实验和复现实验中这些成对关系完全相同,则 P=1P = 1P=1;如果完全不同,则 PPP 很低。
它的意义是:
很多论文的核心发现其实是系统之间的优劣关系,而不是绝对分数。PPP 可以直接评估这些发现是否复现。
这对 NLP/ML 研究尤其重要。因为模型论文经常真正想证明的是:“我的方法比 baseline 好”。如果分数略有差异但这个结论稳定,那么研究发现仍然具有较高复现性。
十二、QRA 支持三个评估层级
QRA 不仅区分结果类型,还区分评估粒度。文章提出三个层级:
1. 系统层级 system level
关注单个系统的结果是否复现。
例如:
- BERT 在原实验和复现实验中的 F1 是否接近?
- GPT-2-large 的人工评分是否稳定?
这主要适合 Type I 和 Type III。
2. 质量标准层级 quality criterion level
关注某个质量维度下多个系统的结果是否复现。
例如:
- 在 fluency 维度上,所有系统的评分关系是否稳定?
- 在 acceptability 维度上,系统排序是否一致?
这对人工评价特别重要,因为不同质量维度的复现性可能完全不同。
3. 研究层级 study level
关注整个研究的总体复现性。
例如,一项研究有多个系统、多个质量维度,QRA 可以给出整体评估。
但作者也提醒,研究层级的平均值可能掩盖差异。比如某个质量标准复现性很好,另一个质量标准复现性很差,平均之后可能看起来只是“一般”。因此,不能只看 study level,还要看 QC level 和 system level。
十三、三个案例说明了 QRA 的实际价值
论文用三个案例展示 QRA 的作用。
案例一:科学定义生成中的 Fluency 评价
第一个案例来自 ReproNLP 2024,包括一个原始实验和两个复现实验,总共三个可比较实验。
质量标准只有一个:Fluency。
三个系统包括:
- SVM
- GeDi
- DExpert
结果显示:
- Type I 的 CV∗CV^*CV∗ 处于中等水平,说明单个系统的具体分数复现性一般;
- Type II 的相关性非常高;
- Type IV 的 P=1P = 1P=1,说明系统排名完全一致。
这个案例说明:
即使绝对分数没有很好复现,系统之间的相对关系和核心发现仍然可以高度复现。
这对 NLP 评价很重要。因为很多时候我们并不要求每次实验分数完全一样,而是希望系统优劣判断稳定。
案例二:新闻标题评价中的 Overall Quality 和 Sociopolitical Acceptability
第二个案例比较了两个实验,涉及两个质量标准:
- Overall Quality
- Sociopolitical Acceptability
结果非常有意思。
对于 Sociopolitical Acceptability,复现性总体较好:
- Type I 的 CV∗CV^*CV∗ 较好;
- Type II 的相关性较高;
- Type IV 的系统排名也相对较稳定。
但对于 Overall Quality,复现性很差:
- Type I 复现性差;
- Type II 相关系数甚至接近 −1-1−1;
- Type IV 的 P=0P = 0P=0,说明系统比较结论完全没有复现。
这个案例说明:
同一项研究中的不同质量标准,复现性可能截然不同。
这对人工评价尤其重要。因为“总体质量”这种宽泛标准可能非常主观,导致不同实验中的评价者理解不同;而“社会政治可接受性”这样的标准可能更具体,因此更容易复现。
这也提醒 NLP 研究者:设计人工评价时,不要只写一个模糊的 “overall quality”,而要尽量明确质量维度和评价标准。
案例三:自动作文评分中的 Weighted F1
第三个案例来自 REPROLANG 2020,包括 8 个可比较实验,评估自动作文评分系统的 weighted F1。
这里有 11 个系统变体,例如:
- 使用词 n-gram 的系统;
- 使用 POS n-gram 的系统;
- 使用 dependency n-gram 的系统;
- 使用 domain-specific features 的系统;
- 使用 embeddings 的系统;
- 是否加入 language identity feature。
结果显示,不同系统类型的复现性差异明显:
- 使用 POS n-gram 的系统复现性最好;
- dependency n-gram、word n-gram 也较好;
- 使用 domain-specific features 或 embeddings 的系统复现性较差;
- 是否加入 language identity feature 对复现性影响不大。
这个案例说明:
复现性不仅受实验设计影响,也受系统类型影响。
更重要的是,这些实验并不完全相同。有些测试数据切分、随机种子、运行环境不同。作者进一步比较了两个实验子集:
- 测试数据切分和随机种子相同的实验;
- 测试数据切分和随机种子不同的实验。
结果很清楚:
| 实验条件 | mean CV∗CV^*CV∗ | Kendall’s WWW | PPP |
|---|---|---|---|
| 相同 test data splits 和 seed | 8.205 | 0.713 | 0.706 |
| 不同 test data splits 和 seed | 13.998 | 0.509 | 0.558 |
也就是说:
实验属性越一致,复现性越好;实验属性越不同,复现性越差。
这直接支持了 QRA 框架中“实验属性相似性”这一核心设定。
十四、这篇文章的主要贡献
这篇论文的贡献可以概括为四点。
第一,它把 NLP/ML 的复现性问题从定性判断推进到定量评估。以往我们说“复现成功/失败”,但 QRA 让我们可以说:“在系统层级,CV∗CV^*CV∗ 是多少;在质量标准层级,Kendall’s WWW 是多少;在研究发现层级,PPP 是多少。”
第二,它区分了四类常见评价结果,避免用同一种指标粗暴评估所有结果。单个分数、分数集合、分类标签、系统比较发现,本来就应该用不同指标。
第三,它强调多层级评估。单个系统的分数可能不稳定,但系统排名可能稳定;某个质量标准可能复现性差,但另一个质量标准可能复现性好。这比简单给出一个整体结论更细致。
第四,它把实验属性纳入复现性解释。复现性差不再只是一个结果,而可以进一步追问:到底是测试集、指标实现、随机种子、运行环境、评价者还是评价标准导致了差异?
十五、这篇文章对 NLP/ML 研究的启发
这篇文章对 NLP/ML 领域有很强的方法论意义。
尤其是在大语言模型时代,很多实验结果其实存在明显不稳定性,例如:
- prompt 轻微变化会影响输出;
- 解码参数不同会影响结果;
- API 模型版本变化会影响复现;
- 人工评价标准模糊会导致结果波动;
- 运行环境、随机种子、数据切分会影响模型性能;
- 自动指标和人工评价之间经常不一致。
QRA 提供了一种思路:不要只问“结果是否一样”,而要问:
- 哪一种结果复现了?
- 在哪个层级复现了?
- 复现程度是多少?
- 哪些实验属性变化影响了复现性?
- 系统分数不一致时,核心发现是否仍然一致?
这对于评价 LLM、文本生成、机器翻译、摘要、对话系统、自动作文评分、数字人文文本分析等任务都很有参考价值。
十六、如果用于你的数字人文/政策文本研究,可以怎么借鉴?
如果你的研究涉及 文本挖掘、政策文本分类、政策创新识别、数字人文语料库、人工标注、LLM 辅助编码,这篇文章也很有价值。
例如,你可能会遇到这些问题:
- 同一批政策文本,不同编码者标注结果是否一致?
- 同一个 LLM prompt 多次运行,分类结果是否稳定?
- 不同模型对政策创新类型的识别是否保持相同排序?
- 政策文本主题模型换一个随机种子,结果是否类似?
- 人工编码和模型编码之间是否可复现?
- 不同批次语料或不同地方政府文本中,分类体系是否稳定?
QRA 的思想可以迁移过来。
例如:
如果你关注单个分类比例
比如某类政策工具在一个地方政策文本中的占比,可以视为 Type I,用类似 CV∗CV^*CV∗ 的思路看多次测量是否稳定。
如果你关注多个地区的排序
比如不同城市政策创新活跃度排名,可以视为 Type II 或 Type IV,用相关系数或 PPP 来看排名是否复现。
如果你关注人工编码标签
比如将政策文本标为“执行保障”“政策兼容性”“资源投入”等,可以视为 Type III,用 κ\kappaκ 或 α\alphaα 判断一致性。
如果你关注研究结论
比如“资源投入高的城市更容易保持政策创新持续性”,可以视为 Type IV,关注核心发现是否在不同编码方案、不同模型、不同数据子集中保持一致。
所以,这篇论文对你做数字人文和政策文本计算方法也有启发:它提供了一种更严谨地报告“自动化文本分析结果可靠性”的方式。
十七、这篇文章也有一些局限
虽然文章提出了一个很有价值的框架,但也有几点需要注意。
第一,QRA 依赖于“可比较实验”。如果两个实验本身差异太大,结果是否可比较就会成为问题。
第二,实验属性的记录需要研究者有较强的数据管理意识。如果原论文没有详细报告测试集、指标版本、运行环境、随机种子、评价者信息,后续 QRA 分析就会受限。
第三,CV∗CV^*CV∗ 等指标虽然可比较,但解释仍然需要领域背景。例如人工评价和自动指标的阈值不同,不同任务也可能需要不同解释标准。
第四,Type IV 的 PPP 关注成对排名是否一致,但它未必反映差异的统计显著性或实际效应大小。例如 A 比 B 高 0.1 分和高 10 分,在排名上都只是 A 优于 B。
第五,文章主要关注 evaluation results 的复现性,而不是整个模型训练过程、数据构建过程或理论解释的复现性。因此它更适合评价实验复现,而不是覆盖所有复现性问题。
十八、一句话总结
这篇论文的核心意义是:
它把 NLP/ML 中长期模糊的“复现成功/失败”问题,转化为一个可以按结果类型、评价层级和实验属性进行量化分析的问题。
更具体地说,QRA 告诉我们:
- 单个分数是否复现,要看 CV∗CV^*CV∗;
- 一组系统分数关系是否复现,要看相关系数和排序一致性;
- 分类标签是否复现,要看 κ\kappaκ 或 α\alphaα;
- 系统比较发现是否复现,要看成对排名一致比例 PPP;
- 复现性好坏不能脱离实验属性相似性;
- 复现性应分系统层级、质量标准层级和研究层级来报告。
这篇文章很适合作为你理解 计算语言学顶刊如何处理评价方法问题 的案例。它不是提出一个新模型,而是提出一个评价科学问题的通用框架,体现了 Computational Linguistics 这类顶刊对方法论严谨性、概念清晰度和跨研究可比较性的重视。
更多推荐


所有评论(0)