CVPR2026基于未来感知的解耦跨头蒸馏的增量目标检测
一、论文信息
- 论文题目:Incremental Object Detection via Future-Aware Decoupled Cross-Head Distillation
- 论文作者:Chenfeng Yin, De Cheng, Wenlong Luo, Mingyue Zeng, Shizhou Zhang, Nannan Wang, Xinbo Gao
- 发表单位:Xidian University, Northwestern Polytechnical University
- 发表会议:CVPR2026
二、论文研究背景
增量目标检测要求模型持续学习新类别,同时保留旧类别识别能力,广泛应用于自动驾驶、机器人视觉等动态场景。现有基于知识蒸馏的主流方案存在两大关键缺陷:
- 学生模型的检测头与骨干网络之间的紧密耦合导致蒸馏梯度与检测头上新类别监督产生冲突,将检测头特有的偏差注入到骨干网络中,最终削弱了蒸馏效果。
- 增量训练会引发旧类别特征语义漂移,加之新旧 / 未来类别共存带来的前景 - 背景混淆,进一步加剧模型 “学新忘旧” 问题。
三、主要贡献
- 提出 FaCHD 解耦交叉头蒸馏方法将检测头与主干网络解耦,采用双教师模型做交叉头特征解码,结合区域划分与背景概率重构做知识蒸馏,解决新旧任务梯度冲突、检测头偏置问题,提升蒸馏效果。
- 设计 RPSC 原型语义漂移补偿模块构建全局 + 局部多粒度 ROI 原型,计算特征偏移量校准旧类原型,修正增量训练带来的语义漂移;仅重训分类头,有效巩固旧类别知识。
- 模块化联合方案从主干特征和分类决策边界两层协同缓解灾难性遗忘,在 VOC、COCO 两大标准增量检测数据集上,单步 / 多步增量场景均超越现有 SOTA 方法。
四、创新点
- FaCHD 未来感知跨头解耦蒸馏方法,利用两个冻结的互补教师模型(历史教师和中间教师)对学生的感兴趣区域特征进行解码以实现跨头蒸馏。
- 提出了原型语义漂移补偿模块,对旧类别的多粒度原型进行重新校准,有效校准了语义漂移并增强了检测头的稳定性。
五、方法
5.1 整体框架

-
采用两阶段训练范式,通过跨头知识迁移联合对特征学习进行正则化,并通过基于原型的校正来保留分类器层的知识。
-
FaCHD模块:解耦检测头与主干网络,用交叉头蒸馏来稳定主干特征,防止学新忘旧。
- Mt−1M_{t-1}Mt−1:上一阶段的旧模型(完全冻结),负责提供旧类知识。
- MtM_tMt:当前阶段的学生模型
- MtimM_t^{\text{im}}Mtim:一个“中间模型”(完全冻结),它是 MtM_tMt 在当前新类别上训练出的临时版本,只学过新类,没有旧类知识,用来提供“未来类别”的信息。
- 交叉头蒸馏的工作流程
- 输入图像同时经过三个模型,提取感兴趣区域(ROI)特征进行解码;MtM_tMt 提取 ROI 特征后,不直接用自己的检测头做蒸馏,而是:用 Mt−1M_{t-1}Mt−1 的旧分类头 Ht−1H_{t-1}Ht−1 解码,得到旧类预测 prt−1p_r^{t-1}prt−1;用 MtimM_t^{\text{im}}Mtim 的新分类头 HtimH_t^{\text{im}}Htim 解码,得到新类预测 primp_r^{\text{im}}prim;
- 这两个预测结果 prt−1p_r^{t-1}prt−1 和 primp_r^{\text{im}}prim 被拼接起来,形成完整的蒸馏目标 pˉr\bar{p}_rpˉr;
- 学生模型 MtM_tMt 的检测头输出 prch,t−1p_r^{\text{ch},t-1}prch,t−1 与这个蒸馏目标计算 KL 散度损失 LFaCHDL_{\text{FaCHD}}LFaCHD,只用来更新主干网络,不更新检测头,实现“解耦”。
- 为什么这样做:
传统蒸馏会让新类别梯度污染主干特征,而 FaCHD 把分类头和主干拆开:
- 旧类知识来自冻结的旧模型,不会被新类别梯度影响
- 蒸馏损失只约束主干,让主干既能学好新类,又能保留旧类的特征模式,避免 “学新忘旧”

区域原型语义校正(RPSC)模块
- 语义漂移:模型主干更新后,即使是同一旧类,提取出的特征也会和上一阶段发生偏移,导致分类头判断出错,这就是 “语义漂移”。
- 流程
- 旧模型 Mt−1M_{t-1}Mt−1 和当前模型 MtM_tMt 同时处理当前数据集,提取同一旧类的 ROI 特征,得到旧原型 zt−1z_{t-1}zt−1 和新原型 ztz_tzt
- 计算两者的特征差 Δc\Delta_cΔc,得到语义偏移量
- 用这个偏移量补偿旧类原型,得到修正后的旧原型
- 把修正后的旧原型 + 新类原型放在一起,冻结主干和 RPN,只重新训练分类头 HtH_tHt,让分类决策边界重新适配更新后的主干特征。
5.2 未来感知解耦跨头蒸馏(FaCHD模块)
增量目标检测(IOD)要求模型适配新增类别,同时保留对先前学习类别区分能力。然而,新类别监督信号与旧类别蒸馏信号会在共享分类器上产生相互冲突的梯度,造成偏向性优化,并加速灾难性遗忘。为解决该问题,FaCHD 将分类头与主干网络解耦,并提出一套双教师交叉头蒸馏策略,在多阶段增量任务间提供稳定、一致的监督引导。
- 双教师框架:
由旧类别专家教师 Mt−1M_{t-1}Mt−1 与新类别中间教师 MtimM_t^\text{im}Mtim 构成。Mt−1M_{t-1}Mt−1 为留存历史知识提供可靠监督;而 MtimM_t^\text{im}Mtim 仅由当前阶段数据集 DtD_tDt 优化,提供与新类别学习适配的自适应监督。
- 蒸馏区域:旧教师RPN输出候选框,仅在这些区域做蒸馏
- IoU 划分规则:以阈值 λ2\lambda_2λ2 区分低重叠(R1\mathcal{R}_1R1,偏旧类)、高重叠(R2\mathcal{R}_2R2,偏新类)ROI,后续对两类区域采用差异化背景概率校正。
R1={dj∈R ∣ ∀yi∈Yt, IoU(dj,yi)≤λ2} \mathcal{R}_1 = \left\{ d_j \in \mathcal{R} \,\big|\, \forall y_i \in \mathcal{Y}_t,\; \mathrm{IoU}(d_j, y_i) \leq \lambda_2 \right\} R1={dj∈R ∀yi∈Yt,IoU(dj,yi)≤λ2}
R2={dj∈R ∣ ∀yi∈Yt, IoU(dj,yi)>λ2} \mathcal{R}_2 = \left\{ d_j \in \mathcal{R} \,\big|\, \forall y_i \in \mathcal{Y}_t,\; \mathrm{IoU}(d_j, y_i) > \lambda_2 \right\} R2={dj∈R ∀yi∈Yt,IoU(dj,yi)>λ2}
- 教师端背景概率重构
- 融合双教师各自优势信息:旧教师拥有稳定可靠的旧类别知识;中间教师适配当前增量阶段的新类别数据;
通过对两类 IoU 划分区域差异化交叉加权,构建“兼顾新旧信息、具备未来(新类)感知”的软概率,作为后续蒸馏目标的组成部分。
rrr:某一个蒸馏ROI区域
R1\mathcal{R}_1R1:与新类别真值框IoU≤λ2\mathrm{IoU} \leq \lambda_2IoU≤λ2的区域,大概率属于旧类别
R2\mathcal{R}_2R2:与新类别真值框IoU>λ2\mathrm{IoU} > \lambda_2IoU>λ2的区域,大概率包含新类别;
ccc:前景类别概率
bbb:背景概率
t−1\mathrm{t-1}t−1:旧类别专家教师Mt−1M_{t-1}Mt−1的输出
im\mathrm{im}im:新类别中间教师MtimM_t^\text{im}Mtim的输出
ppp:原始概率分布
- 疑似旧类区域
P^rc,im=Prc,im⋅Prb,t−1,r∈R1, \hat{\mathrm{P}}_r^{c,\mathrm{im}} = \mathrm{P}_r^{c,\mathrm{im}} \cdot \mathrm{P}_r^{b,\mathrm{t-1}},\quad r \in \mathcal{R}_1, P^rc,im=Prc,im⋅Prb,t−1,r∈R1,
Prc,im\mathrm{P}_r^{c,\mathrm{im}}Prc,im:中间教师输出的各类前景概率
Prb,t−1\mathrm{P}_r^{b,\mathrm{t-1}}Prb,t−1:旧教师输出的背景概率
用旧教师可靠的背景信息,对中间教师的新类前景概率做加权校正
- 疑似新类区域
P^rc,t−1=Prc,t−1⋅Prb,im,r∈R2, \hat{\mathrm{P}}_r^{c,\mathrm{t-1}} = \mathrm{P}_r^{c,\mathrm{t-1}} \cdot \mathrm{P}_r^{b,\mathrm{im}},\quad r \in \mathcal{R}_2, P^rc,t−1=Prc,t−1⋅Prb,im,r∈R2,
用中间教师适配新数据的背景估计,校正旧教师的旧类前景概率
- 教师侧蒸馏目标拼接
PrP_rPr:蒸馏区域 rrr 上,双教师融合得到的蒸馏目标概率向量(教师侧输出,作为知识蒸馏的监督信号)
concat(A,B)\mathrm{concat}(A,B)concat(A,B):向量拼接操作,把概率向量 AAA、BBB 在类别维度拼接成一个长向量
p^\hat{p}p^:经过上一步背景概率校正后的前景概率
PPP:教师原始输出前景概率
-
上标:
ccc:前景类别
t−1\mathrm{t-1}t−1:旧类别教师Mt−1M_{t-1}Mt−1
im\mathrm{im}im:新类别中间教师MtimM_t^\text{im}Mtim
pˉr={concat(p^rc,im, prc,t−1),r∈R1,concat(p^rc,t−1, prc,im),r∈R2, \bar{\mathbf{p}}_r = \begin{cases} \mathrm{concat}\big(\hat{\mathbf{p}}_r^{c,im},\, \mathbf{p}_r^{c,t-1}\big), & r \in \mathcal{R}_1, \\ \mathrm{concat}\big(\hat{\mathbf{p}}_r^{c,t-1},\, \mathbf{p}_r^{c,im}\big), & r \in \mathcal{R}_2, \end{cases} pˉr={concat(p^rc,im,prc,t−1),concat(p^rc,t−1,prc,im),r∈R1,r∈R2,
- 分支1:疑似旧类区域
Prc,im\mathrm{P}_r^{c,\mathrm{im}}Prc,im:中间教师新类前景概率,已用旧教师背景信息校正
Prc,t−1\mathrm{P}_r^{c,\mathrm{t-1}}Prc,t−1:未经校正的旧教师原生旧类前景概率;
该区域更可能是旧类别,优先保留旧教师稳定可靠的原始旧类知识,仅对新类概率做校正。 -
分支2:疑似新类区域
Prc,t−1\mathrm{P}_r^{c,\mathrm{t-1}}Prc,t−1:旧教师旧类前景概率,已用中间教师背景信息校正
Prc,im\mathrm{P}_r^{c,\mathrm{im}}Prc,im:未经校正的中间教师原生新类前景概率;
- pch,t−1=softmax(Ht−1(z)),pch,im=softmax(Htim(z)), \begin{aligned} p^{ch, t-1} &= \mathrm{softmax}\big(\mathcal{H}_{t-1}(\mathbf{z})\big), \\ p^{ch, im} &= \mathrm{softmax}\big(\mathcal{H}_{t}^{im}(\mathbf{z})\big), \end{aligned} pch,t−1pch,im=softmax(Ht−1(z)),=softmax(Htim(z)),
zzz:学生模型主干网络、RPN、ROI 提取器输出的 ROI 特征向量
Ht−1H_{t-1}Ht−1:旧阶段教师模型的冻结分类头,全程不参与参数更新
HtimH_t^\text{im}Htim:中间新类教师模型的冻结分类头,参数固定;
ch\mathrm{ch}ch(交叉头):代表不使用学生自身分类头,而是将学生特征送入教师的分类头做预测,是 FaCHD「解耦交叉蒸馏」的核心操作;
softmax(⋅)\mathrm{softmax}(\cdot)softmax(⋅):将分类头输出的原始logit\mathrm{logit}logit转换成各类别归一化概率分布
整体逻辑:学生的ROI特征不经过自身检测分类头,而是复用完全冻结的两套教师分类头生成预测,后续也是用这两组交叉预测构造蒸馏损失,约束只更新学生主干,隔离分类头参数冲突,实现主干与分类头解耦
5. P^rch,c,im=Prch,c,im⋅Prch,b,t−1,r∈R1, \hat{\mathrm{P}}_r^{\mathrm{ch},c,\mathrm{im}} = \mathrm{P}_r^{\mathrm{ch},c,\mathrm{im}} \cdot \mathrm{P}_r^{\mathrm{ch},b,t-1}, \quad r \in \mathcal{R}_1, P^rch,c,im=Prch,c,im⋅Prch,b,t−1,r∈R1,
P^rch,c,t−1=Prch,c,t−1⋅Prch,b,im,r∈R2. \hat{\mathrm{P}}_r^{\mathrm{ch},c,t-1} = \mathrm{P}_r^{\mathrm{ch},c,t-1} \cdot \mathrm{P}_r^{\mathrm{ch},b,\mathrm{im}}, \quad r \in \mathcal{R}_2. P^rch,c,t−1=Prch,c,t−1⋅Prch,b,im,r∈R2.
ch\mathrm{ch}ch: cross-head,代表上一步用学生 ROI 特征输入冻结教师分类头得到的交叉头预测分布
t−1\mathrm{t-1}t−1:对应旧类别教师输出的交叉头概率
im\mathrm{im}im:对应中间新类教师输出的交叉头概率
ppp:原始交叉头概率
p^\hat{p}p^:经过背景信息校正后的前景概率
疑似旧类区域
P^rch,c,im=Prch,c,im⋅Prch,b,t−1,r∈R1, \hat{\mathrm{P}}_r^{\mathrm{ch},c,\mathrm{im}} = \mathrm{P}_r^{\mathrm{ch},c,\mathrm{im}} \cdot \mathrm{P}_r^{\mathrm{ch},b,t-1}, \quad r \in \mathcal{R}_1, P^rch,c,im=Prch,c,im⋅Prch,b,t−1,r∈R1,
用旧教师交叉头输出的背景置信度,加权校正中间教师交叉头的新类前景概率,目的是和教师端校正公式结构完全对称,保证学生与老师概率校正逻辑一一对应
疑似新类区域
P^rch,c,t−1=Prch,c,t−1⋅Prch,b,im,r∈R2. \hat{\mathrm{P}}_r^{\mathrm{ch},c,t-1} = \mathrm{P}_r^{\mathrm{ch},c,t-1} \cdot \mathrm{P}_r^{\mathrm{ch},b,\mathrm{im}}, \quad r \in \mathcal{R}_2. P^rch,c,t−1=Prch,c,t−1⋅Prch,b,im,r∈R2.
使用中间教师交叉头输出的背景置信度,加权校正旧教师交叉头的旧类前景概率
-
组装完整预测概率向量的一步
Pˉrch={concat(P^rch,c,im, Prch,c,t−1),r∈R1,concat(P^rch,c,t−1, Prch,c,im),r∈R2. \bar{\mathbf{P}}_r^{ch} = \begin{cases} \mathrm{concat}\big(\hat{\mathbf{P}}_r^{ch,c,im},\; \mathbf{P}_r^{ch,c,t-1}\big), & r \in \mathcal{R}_1, \\ \mathrm{concat}\big(\hat{\mathbf{P}}_r^{ch,c,t-1},\; \mathbf{P}_r^{ch,c,im}\big), & r \in \mathcal{R}_2. \end{cases} Pˉrch={concat(P^rch,c,im,Prch,c,t−1),concat(P^rch,c,t−1,Prch,c,im),r∈R1,r∈R2.
跟教师模型操作一样 -
LFaCHD=1∣R∣∑r∈RKL(Pˉr ∥ Pˉrch). \mathcal{L}_{\mathrm{FaCHD}} = \frac{1}{|\mathcal{R}|} \sum_{r \in \mathcal{R}} \mathrm{KL}\big(\bar{\mathbf{P}}_r \,\|\, \bar{\mathbf{P}}_r^{\mathrm{ch}}\big). LFaCHD=∣R∣1r∈R∑KL(Pˉr∥Pˉrch).
遍历每一个蒸馏区域,分别计算教师概率和学生概率的 KL 散度,把所有区域的 KL 值加起来,除以区域总数,取平均值,防止区域数量多少影响损失大小
作用:这个损失会约束学生主干网络,让学生输出的概率分布尽量贴近双教师融合得到的标准分布,从而保留旧类别特征知识;
注意:此损失只更新学生主干,不更新教师与学生分类头。 -
Ltotal=Lcls+Lbbox+αLFaCHD, \mathcal{L}_{\mathrm{total}} = \mathcal{L}_{\mathrm{cls}} + \mathcal{L}_{\mathrm{bbox}} + \alpha \mathcal{L}_{\mathrm{FaCHD}}, Ltotal=Lcls+Lbbox+αLFaCHD,
模型总体损失=目标检测分类损失+边界框回归损失+平衡权重超参数*FaCHD蒸馏损失
5.3 区域原型语义校准

- 模型经过 FaCHD 更新主干后,同一旧类物体提取出的特征会发生微小偏移(语义漂移)。原本存储的旧类别特征模板(原型)和新特征不匹配,会导致分类头识别旧物体准确率下降。同时增量学习还存在 “近期偏向”(模型更偏向新类别)
- 不改动已经优化好的主干与 RPN,仅对分类头做优化:先构建多粒度(全局 + 局部)的类别特征原型,计算新旧模型间的特征偏移量,修正旧类原型;最后用修正后的原型重新训练分类头,重置分类决策边界,加固旧类知识。
- ROI特征提取
zi=RoiAlign(r, Mf(xi)) z_i = \mathrm{RoiAlign}\big(r,\, \mathcal{M}_f(x_i)\big) zi=RoiAlign(r,Mf(xi))
- xix_ixi:输入图像
- Mf\mathcal{M}_fMf:模型主干网络
- rrr:RPN 输出的目标候选框;
- RoiAlign\mathrm{RoiAlign}RoiAlign:检测任务标准算子,把不同大小的候选框特征统一为固定维度
- ziz_izi:最终得到的单个候选框感兴趣区域(ROI)特征(RPSC 所有计算的基础数据)
把图像送入主干提取特征,再截取每个目标框对应的局部特征,统一尺寸后得到特征向量,后续所有原型都由这类向量计算而来。
4. 构建两类原型(全局原型 + 局部原型)
μCg=1nc∑i=1nczic, \mu_{\mathcal{C}}^g = \frac{1}{n_c} \sum_{i=1}^{n_c} z_i^c, μCg=nc1i=1∑nczic,
原型 = 某一类物体所有特征的 “代表模板”,用来表征该类的典型特征。论文设计双粒度原型,兼顾整体特征与局部细节。
把同一个类别所有目标的特征全部相加,再取平均值,得到这个类别的整体特征模板。优点是简洁通用,缺点是忽略类内细微差异。
Sjc={zic ∣ si,jc>γ}, S_j^c = \big\{ z_i^c \,\big|\, s_{i,j}^c > \gamma \big\}, Sjc={zic
si,jc>γ},
μcℓ=1∣Skℓ∣∑zic∈Skℓzic, k=1,…,K, \mu_{c}^{\ell} = \frac{1}{\big|S_k^{\ell}\big|} \sum_{z_i^c \in S_k^{\ell}} z_i^c,\; k=1,\dots,K, μcℓ=
Skℓ
1zic∈Skℓ∑zic,k=1,…,K,
同一类物体姿态、形态不同,全局模板会抹平这些差异。该步骤把相似的特征聚成小群组,每个群组生成一个局部模板,让原型能覆盖类内多种形态。
- 计算语义漂移量
δ=zt−zt−1, \delta = z^t - z^{t-1}, δ=zt−zt−1,
差值=当前学生模型提取的 ROI 特征-历史旧模型提取的 ROI 特征 - 原型漂移补偿
{μ^cg=μc g,(t−1)+Δ^c, c∈C1:t−1,μ^cℓ=μc ℓ,(t−1)+Δ^c, c∈C1:t−1. \begin{cases} \hat{\mu}_c^g = \mu_c^{\,g,(t-1)} + \hat{\Delta}_c,\; & c \in \mathcal{C}_{1:t-1},\\ \hat{\mu}_c^\ell = \mu_c^{\,\ell,(t-1)} + \hat{\Delta}_c,\; & c \in \mathcal{C}_{1:t-1}. \end{cases} {μ^cg=μcg,(t−1)+Δ^c,μ^cℓ=μcℓ,(t−1)+Δ^c,c∈C1:t−1,c∈C1:t−1.
μc g,(t−1)/μc ℓ,(t−1)\mu_c^{\,g,(t-1)} / \mu_c^{\,\ell,(t-1)}μcg,(t−1)/μcℓ,(t−1):增量训练前的旧全局 / 局部原型
μ^\hat{\mu}μ^:补偿校正后的新原型
Δ^c\hat{\Delta}_cΔ^c:类别ccc的整体语义偏移量
旧类原型已经跟不上更新后的主干特征,我们把之前算出的整体偏移量加到旧原型上,相当于把旧模板“挪到”新特征的位置,消除语义漂移。
7. 原型重训分类头:校正完原型后,用原型替代真实样本训练分类头(无需旧类标注)
P^ct−1=Softmax(H(μt−1,c)),P^ct=Softmax(H(μt,c)), \begin{aligned} \hat{\mathrm{P}}_c^{t-1} &= \mathrm{Softmax}\big(\mathcal{H}(\mu_{t-1,c})\big), \\ \hat{\mathrm{P}}_c^{t} &= \mathrm{Softmax}\big(\mathcal{H}(\mu_{t,c})\big), \end{aligned} P^ct−1P^ct=Softmax(H(μt−1,c)),=Softmax(H(μt,c)),
把新旧原型依次送入分类头,得到预测结果。
Lre=−∑c∈C1:t−1yclog(P^ct−1)−λ∑c∈Ctyclog(P^ct), \mathcal{L}_{\mathrm{re}} = -\sum_{c \in \mathcal{C}_{1:t-1}} y_c \log\big(\hat{\mathrm{P}}_c^{t-1}\big) -\lambda \sum_{c \in \mathcal{C}_t} y_c \log\big(\hat{\mathrm{P}}_c^{t}\big), Lre=−c∈C1:t−1∑yclog(P^ct−1)−λc∈Ct∑yclog(P^ct),
原型回放损失=-约束分类头正确识别旧类原型-约束分类头正确识别新类原型
不用历史图片,只用校正后的特征模板训练分类头。让分类头重新适配更新后的主干特征,同时兼顾新旧类别,彻底解决漂移和偏向问题。
六、实验
6.1 对比试验

表头 10-10 / 15-5 / 19-1 / 5-15 代表类别增量划分方案(以 Pascal VOC 常见设置举例,前数字 = 初始旧类数量,后数字 = 增量新增类别数量)。
Old:旧类别 mAP,数值越高代表遗忘越少
New:新类别 mAP,数值越高代表学习新物体能力越强
All:全部类别综合 mAP,整体性能核心指标
Joint Training:联合训练(理想上限:一次性使用所有类别数据训练,无遗忘,作为性能天花板参考)
Fine-tuning:直接微调基线,灾难性遗忘极其严重,Old 指标暴跌,是最差 baseline
结论
- 抗遗忘能力极强:多组任务中Old(旧类 mAP)显著优于其他 SOTA,证明 FaCHD+RPSC 架构能有效抑制增量学习的灾难性遗忘;
- 新旧性能均衡:不像部分方法为保旧类严重牺牲新类,或专攻新类大量遗忘旧类,本文方法可以在新旧类别间取得良好平衡;
- 通用性强:四种完全不同的类别增量划分设置下综合 All mAP 稳定领先,证明方案适配多种增量目标检测场景
- 性能上限距离理想联合训练(Joint Training)差距微小,是极具竞争力的增量目标检测算法。
6.2 MS COCO 数据集上增量目标检测(IOD)的对比实验表

- 40+40:初始训练 40 个基础类别,增量阶段新增 40 个类别
- 70+10:初始训练 70 个基础类别,增量阶段仅新增 10 个类别,更考验旧类留存
结论 - COCO 大数据集有效性:在 COCO 复杂多尺度目标场景,本文 FaCHD-RPSC 方法在两种截然不同的增量设置下,主指标 AP、严格指标 AP75 均优于全部对比增量检测算法
- 抗遗忘与精准定位优势:AP75 持续领先,代表模型在高匹配要求的检测任务中,不会因增量学习丢失精细特征;
- 场景泛化性:无论一次性新增大量类别(40+40)还是少量类别(70+10),模型均稳定保持最优综合性能,方案适配多种 COCO 增量划分;
- 性能距离联合训练理想上限仍存在小幅差距,是增量学习领域普遍存在的固有约束。
6.3 PASCAL VOC 数据集上增量目标检测(IOD)的对比实验表

- 1-X:旧类别 mAP(初始训练的类别,数值越高遗忘越少)
- X+1-20:新类别 mAP(增量阶段新增类别,代表学新类能力)
- 1-20:所有类别综合 mAP,整体性能指标
结论 - 优异的抗遗忘特性:多组任务中旧类别 mAP 显著优于对比 SOTA,尤其在 10-5、15-1 这类旧类占比大的设置下优势巨大
- 学习新类能力灵活适配:在 5-5(大量新增类别)场景新类精度全场最优;仅单类增量时新类性能适度让步,换取旧类知识留存
- 强通用性:四种差异巨大的增量划分任务中,整体综合 mAP 稳定领先多数现有增量检测算法
- 距离联合训练的理想性能天花板仍存在差距,是增量学习领域普遍存在的固有局限。
七、消融实验

FaCHD、RPSC 两个核心模块的消融实验,在 PASCAL VOC 三种增量划分(10-10 / 10-5 / 5-5)下测试,指标 mAP 越高性能越好。
最右侧灰色列1-20是全部类别综合 mAP,用于整体性能评判。
结论
- FaCHD 是性能提升的核心贡献模块,单独使用即可带来显著增益;
- RPSC 单独使用增益有限,但可以和 FaCHD 形成配合
- 完整双模块架构(FaCHD+RPSC)在全部三种增量划分任务中取得最优综合 mAP,验证了整套方法设计的必要性与合理性,缺一不可。

两组超参数敏感性实验柱状图,实验场景:PASCAL VOC 10-10 增量设置,评价指标 mAP(越高性能越好) - 左图:FaCHD 蒸馏损失权重 α
- 右图:RPSC 原型损失平衡系数 λ
- 1-10:初始旧类别 mAP
- 11-20:增量新类别 mAP
- 1-20:全部类别综合 mAP
- 左图:α=20是平衡新旧类性能的最优选择:太小,蒸馏约束不足,旧类遗忘加剧; 过大,模型过度约束主干,影响新类别学习。
- 右图: λ=0.2是综合最优超参数;数值越高,对新类原型的约束权重越高,会损害旧类别识别效果,综合性能下降。
- 需要精细调参平衡 “保留旧知识” 和 “学习新类别” 两个目标。
更多推荐



所有评论(0)