(论文速读)基于两步保形预测的自适应边界盒不确定性
论文题目:Adaptive Bounding Box Uncertainties via Two-Step Conformal Prediction(基于两步保形预测的自适应边界盒不确定性)
会议:ECCV2024
摘要:量化模型的预测不确定性对于自动驾驶等安全关键应用至关重要。我们考虑在多目标检测中量化这种不确定性。特别是,我们利用保形预测来获得具有保证覆盖范围的对象边界框的不确定性区间。这样做的一个挑战是边界框预测取决于对象的类标签。因此,我们开发了一种新的两步共形方法,将预测类标签的不确定性传播到边界盒的不确定性区间。这扩大了我们的保形覆盖保证的有效性,包括错误分类的对象,从而提供更可操作的安全保证。此外,我们研究了新的集合和分位数回归公式,以确保边界框间隔适应对象大小,从而实现更平衡的覆盖。在二维边界框定位的真实数据集上验证了我们的两步方法,我们发现期望的覆盖水平在几乎严格的预测不确定性区间内得到满足。
基于两步式Conformal Prediction的自适应边界框不确定性量化
引言
在自动驾驶、机器人等安全关键应用中,我们不仅需要模型给出预测结果,更需要知道这个预测有多可靠。想象一下,一辆自动驾驶汽车检测到前方有一辆车,但如果模型对边界框的位置非常不确定,车辆控制系统就应该采取更保守的策略。
这篇发表在ECCV 2024的论文提出了一个优雅的框架:利用Conformal Prediction(CP)为目标检测的边界框提供带有概率保证的不确定性区间。核心承诺是:
"预测区间以至少 (1-α) 的概率覆盖目标的真实边界框,对任何已知类别都成立"
其中 α 是用户可接受的误差率(如 10%)。

图1:论文方法在测试图像上的效果。红色为真实边界框,绿色阴影区域为预测区间
核心思想
用"保守区间"代替"单一预测"
不再预测一个精确的框,而是预测一个区间范围:
原来:模型说 "车的左边界在x=100像素"
现在:模型说 "车的左边界在x=95到105像素之间,我有90%的把握"
背景知识
什么是Conformal Prediction?
Conformal Prediction是一种分布无关的不确定性量化框架,它的核心优势是:
- 模型无关:可以应用于任何"黑盒"模型
- 有限样本保证:不需要无限数据,校准集大小有限即可
- 无分布假设:只需要数据满足可交换性(exchangeability)
CP的基本流程是:
- 在校准集上计算非一致性分数(nonconformity scores)
- 计算分数的分位数作为阈值
- 对新样本,基于阈值构建预测集/区间
数学上,对于目标覆盖率 (1-α),CP保证:
![]()
目标检测设置
在多目标检测中,每个检测对象包含:
- 边界框坐标:

- 类别标签:

检测器有两个输出头:
- 分类头
:输出类别概率 - 回归头
:输出边界框坐标
问题分析:现有方法的局限性
问题1:类别预测可能出错
这是一个被先前工作忽视的关键问题。边界框预测区间的构建依赖于类别条件CP,即我们为每个类别分别计算conformal分位数。但如果类别预测错误呢?
假设真实类别是"汽车",但模型预测为"卡车"。我们会使用"卡车"的分位数来构建预测区间,这就破坏了覆盖保证!
先前方法(如Andéol等人的工作)的假设是
(预测类别等于真实类别),这在实践中是不现实的。
问题2:固定宽度区间不自适应
标准CP使用残差
作为分数,产生的预测区间宽度固定。但直观上:
- 大目标:可能需要更宽的区间
- 小目标:相同宽度的区间可能过于保守
这导致覆盖率在不同大小的目标上不平衡。
问题3:多重检验问题
边界框有4个坐标,对每个坐标分别应用CP相当于做4次假设检验。如果每个测试的错误率是 α,总体错误率可能高达 4α!
核心创新

创新1:两步式Conformal框架
论文提出的核心创新是将不确定性量化分为两步:
第一步:类别标签的Conformal预测集
使用类别条件CP为类别标签生成预测集
。例如,对于一个目标,预测集可能是 {汽车, 卡车},表示真实类别有99%的概率在这个集合中。
方法细节:
- 分数函数:

- 为每个类别计算分位数

- 预测集:

第二步:边界框坐标的预测区间
基于第一步的标签预测集选择边界框分位数:
![]()
这个max策略虽然保守,但保证了即使类别预测错误(只要真实类别在预测集中),边界框覆盖仍然有效。
联合保证:

设置
= 0.01,可以近似获得
的边界框覆盖率。
创新2:自适应边界框区间
论文提出了三种边界框预测区间方法:
方法1:Box-Std(标准方法)
- 分数:

- 区间:

- 特点:固定宽度,最简单但不自适应
方法2:Box-Ens(集成方法)
- 使用模型集成的标准差
作为归一化因子 - 分数:

- 区间:

- 特点:区间宽度随模型不确定性自适应调整
方法3:Box-CQR(分位数回归方法)
- 训练额外的分位数预测头
和 
- 分数:

- 区间:

- 特点:区间可以不对称,更灵活地适应数据分布
创新3:Max-Rank多重检验校正
传统Bonferroni校正将
除以检验次数m,但这过于保守。论文采用了Timans等人提出的max-rank方法:
- 利用边界框坐标之间的正相关性
- 在秩空间中操作,更加鲁棒
- 相比Bonferroni,获得显著更紧凑的区间
实验验证
实验设置
- 数据集:COCO、Cityscapes、BDD100k
- 目标类别:person, bicycle, motorcycle, car, bus, truck
- 检测器:Faster R-CNN、YOLOv3、DETR、Sparse R-CNN
- 参数设置:
= 0.01,
= 0.1,目标覆盖率约90%
主要结果
1. 覆盖率验证

论文在BDD100k上的结果显示:
- 类别条件覆盖:所有类别都达到目标90%覆盖率
- 按目标大小分层:Box-Ens和Box-CQR在不同大小目标上覆盖更均衡
Box-Std的问题:
- 小目标:过度覆盖(区间太宽)
- 大目标:覆盖不足(区间太窄)
自适应方法(Box-Ens/Box-CQR)通过动态调整区间宽度缓解了这一问题。
2. 与现有方法对比

| 方法 | 双侧区间MPIW | 覆盖率 |
|---|---|---|
| Deep Ensembles | 12.31 | 0.21 ❌ |
| GaussianYOLO | 7.00 | 0.08 ❌ |
| Andéol et al. (Best) | N/A | 0.91 ✓ |
| Box-Std (本文) | 55.47 | 0.88 ✓ |
关键观察:
- Deep Ensembles和GaussianYOLO严重欠覆盖(没有保证的后果)
- 本文方法在提供双侧区间的同时保持有效覆盖
3. 两步方法的有效性

比较不同标签集方法:
- Top:只取概率最高的类别,无保证
- Naive:密度水平集,依赖校准假设
- ClassThr:conformal方法,有保证
- Full:全集,过于保守
结果显示ClassThr在三个数据集上都能同时满足标签和边界框的覆盖目标,且预测区间实际可用。
方法选择指南
标签集方法选择
| 场景 | 推荐方法 | 原因 |
|---|---|---|
| 分类器准确率高 + 外部验证 | Top | 高效 |
| 模型校准良好 + 只需经验保证 | Naive | 紧凑区间 |
| 需要强安全保证 | ClassThr | 唯一有名义保证的选择 |
边界框方法选择
| 场景 | 推荐方法 | 原因 |
|---|---|---|
| 目标大小相近 | Box-Std | 简单高效 |
| 目标大小变化大 | Box-Ens/Box-CQR | 自适应调整 |
| 有集成模型 | Box-Ens | 利用现有不确定性估计 |
| 可训练额外模块 | Box-CQR | 最灵活的自适应性 |
实际应用场景
自动驾驶中的碰撞避免
安全策略:避开预测区间的外边界
- 检测到前车,边界框区间为 [x_min, x_max]
- 控制器确保与 x_max 保持安全距离
- 即使检测不精确,90%情况下仍安全
机器人抓取中的可靠区域
抓取策略:在预测区间的内边界内操作
- 检测到物体,边界框区间确定可靠区域
- 夹爪对准内边界框定义的区域
- 避免抓取失败的风险
局限性与未来方向
当前局限
- 只针对检测到的目标:对漏检(false negatives)无法提供保证
- 需要可交换性假设:分布偏移下保证可能失效
- ClassThr可能过覆盖:max量化选择策略保守
未来方向
- 扩展到3D检测:方法可直接推广到3D边界框(6个或更多坐标)
- 目标跟踪:时序扩展,考虑帧间相关性
- 更高效的量化选择:基于混淆矩阵的加权策略
- 条件化到目标大小:显式保证不同大小目标的覆盖率
总结
这篇论文的核心贡献是将Conformal Prediction框架优雅地应用于目标检测的不确定性量化,通过创新的两步式设计解决了类别预测错误带来的问题。三种自适应边界框方法(Box-Std、Box-Ens、Box-CQR)提供了灵活的选择,max-rank多重检验校正则进一步提升了实用性。
对于安全关键应用的从业者,这个框架提供了一种后验、高效、有保证的不确定性量化方案,是部署可靠视觉系统的重要工具。
本文为学术论文解读,如有理解偏差欢迎指正。
更多推荐



所有评论(0)