论文阅读 | 红外小目标检测方向 1 | PAL
论文阅读|红外小目标检测方向1
From Easy to Hard: Progressive Active Learning Framework for Infrared Small Target Detection with Single Point Supervision
从易到难:面向单点监督红外小目标检测的渐进式主动学习框架
作者: Chuang Yu, Jinmiao Zhao, Yunpeng Liu, Sicheng Zhao, Yimian Dai, Xiangyu Yue
机构: 中科院沈阳自动化所、清华大学、南开大学、香港中文大学
发表: ICCV 2025
源码: https://github.com/YuChuang1205/PAL
写在前面:这篇文章提出的框架PAL主要用于优化用于SIRST单点监督的伪标签的,他本身不是一个单独的模型,可与任意IRST检测模型搭配使用
摘要
近年来,基于单点监督的单帧红外小目标(SIRST)检测受到广泛关注。然而,最新的单点监督标签演化(LESPS)框架存在训练不稳定、标签过度演化、难以充分发挥嵌入网络性能等问题。受生物逐步适应环境、持续积累知识的启发,本文构建了一种创新的渐进式主动学习(PAL)框架,可驱动现有红外小目标检测网络渐进式、主动地识别并学习更难的样本。具体而言,为避免早期低性能模型导致难样本错误选择,本文提出模型预启动思想,自动选取部分简单样本,帮助模型具备基础的任务专属学习能力;同时提出精细化双更新策略,推动模型合理学习难样本并持续优化伪标签;此外,为缓解标签过度演化风险,合理引入衰减因子,实现目标标注区域扩张与收缩的动态平衡。大量实验表明,搭载本文 PAL 框架的现有红外小目标检测网络在多个公开数据集上均取得了最优(SOTA)性能。更重要的是,PAL 框架可在全监督与单点监督任务间搭建高效且稳定的桥梁。
一、背景
单帧红外小目标(SIRST)检测是红外成像系统的核心技术之一,广泛应用于交通分析、环境观测、海上辅助等领域。但该任务面临复杂背景、目标固有特征稀缺、标注数据不足等诸多挑战。现有研究以全监督为主,但像素级密集标注成本高昂。因此,在单点监督下实现高性能红外小目标检测虽极具挑战但意义重大。
二、本文动机
现有SIRST方法均聚焦全监督,像素级密集标注成本极高。为降低标注成本,Ying 等人近期提出 LESPS 框架,LESPS是目前单点监督IRSTD的代表性框架(CVPR 2023),做法是:给每个目标标一个点,然后通过模型预测不断演化伪标签,逐步从点标注扩展成区域标注。
但实验与分析表明,结合图1可以看出几个问题:
第一,不稳定。LESPS的训练曲线(绿色)抖动很大,不同网络上表现差异也很大。有些网络(比如DNANet)上还算能用,换个网络(比如UIUNet)就崩了。
第二,伪标签容易过度膨胀。标签演化过程中缺乏有效约束,伪标签区域越来越大,把背景也包进去了,导致虚警上升。
第三,嵌入网络的性能发挥不出来。同一个网络在全监督下能跑到很高的IoU,但套上LESPS之后性能差距很大,说明框架本身限制了网络的能力。
PAL的训练曲线(红色)明显更稳定,而且跟全监督(蓝色)的趋势基本一致。
为解决上述问题,本文尝试构建高效稳定的红外小目标检测新框架。受生物逐步适应环境、持续积累知识的启发,本文提出核心思路:网络模型的学习也应遵循由易到难的过程。优秀的学习过程应循序渐进,兼顾当前学习者(模型)的能力,而非直接平等对待所有任务(样本)。基于此,本文构建创新的渐进式主动学习框架,驱动现有红外小目标检测网络渐进式、主动地识别并学习更难样本。
三、主要贡献
本文 PAL 框架可归为自动课程学习(CL)范畴。与现有聚焦全监督或其他弱监督任务的自动课程学习不同,本文首次将其拓展至单点监督任务,为单点监督红外小目标检测构建有效学习框架。实验表明,PAL 框架性能显著提升,在全监督与单点监督任务间搭建了高效稳定的桥梁。
具体贡献如下:
- 构建创新的 PAL 框架,可将现有红外小目标检测网络迁移至单点监督任务,驱动其渐进式、主动学习难样本,实现性能持续提升。
- 提出模型预启动思想,自动选取简单样本,帮助模型在训练初期具备基础任务学习能力;构建简单样本伪标签生成(EPG)策略,完成简单样本初选与对应伪标签生成。
- 提出精细化双更新策略,推动模型合理学习难样本、持续优化伪标签。
- 引入衰减因子缓解标签过度演化风险,实现目标标注区域扩张与收缩的动态平衡。
四、方法
针对单点监督下的细粒度红外小目标检测,本文提出适配所有现有红外小目标检测网络的端到端 PAL 框架。
3.1训练过程分为三个阶段:
(1)模型预启动Model Pre-start(前20% epochs):这个阶段模型啥都不会,就像婴儿,不能直接拿所有样本来训练。PAL的做法是先自动挑一批"简单样本"放进训练池,让模型先建立基本的识别能力。赋予模型初始任务学习能力,避免早期用所有点标签样本训练导致的不稳定、精度差问题。
(2)模型增强Model Enhancement(20%~80% epochs):模型有了基本能力后,开始渐进式地往训练池里加"困难样本"。这里的关键是模型自己决定什么是难样本——当前模型检测不出来的就是难的。随着模型能力增强,越来越难的样本逐步被纳入训练。使模型渐进式、主动识别学习难样本,积累新知识,更新训练池样本伪标签。
(3)模型精细化Model Refinement(后20% epochs):所有样本都已进入训练池,让模型充分学习难样本,这个阶段主要做伪标签的精修。
这种分阶段的课程式学习思想,就解决了LESPS的一个核心矛盾:LESPS让所有样本从一开始就参与训练,但模型初期能力很弱,给出的伪标签质量很差,这些差标签又反过来误导模型——恶性循环。PAL通过控制样本进入训练的节奏打破了这个循环。
其次,Curriculum Learning先学简单的,后学难的,这个过程自动化了,不需要人为定义什么是难什么是简单,模型自己感知。

3.2 模型预启动Model Pre-start(前20% epochs)
不直接使用单点监督标签进行训练,而是选取可生产高质量伪标签的简单样本进行初始训练,帮助模型建立基础红外小目标检测能力。
本文提出EPG 策略实现简单样本选取步骤:
(1)为了减少背景干扰,处理以给定单点标签为中心的局部图像块,而不是整个图像。为了准确检测目标区域,首先使用高斯滤波适当地抑制噪声。其次,使用Canny算子提取目标的轮廓。最后,形态闭合操作减轻轮廓碎片,填充封闭区域以获得分割结果;
(2)用标签点评估分割结果中的连通区域,保留包含标签点且低于阈值的区域为真实目标(红外小目标本来就很小,这里的阈值不需要手动调参,而是根据红外小目标的物理尺寸先验自动定的,论文里EPG 用的裁剪块是 20×20),剔除其余误检区域;
(3)计算目标级召回率,≥设定阈值(0.8)为简单样本,否则为难样本;
(4)将简单样本的分割图像块叠加至原尺寸纯黑背景生成伪标签,补充点标签修正漏检,优化伪标签。
EPG 策略选取带高质量伪标签的简单样本进行初始训练,使模型具备基础任务能力,避免早期难样本引入过多噪声与误导信息。
3.3 精细化双更新策略
伪标签的质量直接影响最终模型的性能。与现有框架直接对所有点标签执行迭代演化不同,模型预启动阶段后,模型具备基础的红外小目标检测能力。PAL的训练过程中有两种更新在交替进行:由粗粒度外部更新与细粒度内部更新组成。
(1)粗粒度外部更新(COU)
负责往训练池里加新的困难样本(每次都加当前情况下相对的简单样本)。具体做法是用当前模型跑一遍还没进训练池的样本,能检测到的就认为模型已经有能力处理了,为它生成伪标签并加入训练池。同时会去除虚假检测(跟真实点标注不重叠的就是假的)。
具体过程:
首先,需要评估预备池中当前模型可识别的相对简单样本: 如果一个样本,它的漏检率和误检率都低于某个阈值,就为简单样本;否则就是困难样本。
然后,对选取的简单样本,执行物件目标剔除。也就是,根据真实标签点,直接移除与任意真实标签点无交集的预测目标区域。缓解漏检问题,确保有效学习。
考虑到模型学习难样本后会具备更强的认知与学习能力,本文在模型增强阶段周期性执行 COU。这能够驱动模型渐进式、主动地识别与学习更困难的样本,同时不会对简单样本产生灾难性遗忘。
(2)细粒度内部更新(FIU)
负责精修已在训练池里的样本的伪标签。这里引入了一个衰减因子来控制标签演化的幅度——解决LESPS里伪标签无限膨胀的问题。具体来说,每次更新时,候选区域的面积会乘以一个衰减因子(论文里取0.97),这样标签的扩张速度会逐渐放缓,最终收敛到一个合理的大小。
FIU 分为三个步骤:候选区域提取(每个目标周围抠 d×d 候选区域)、误检区域剔除(每个候选区域做清理(只留和质心重叠的))、伪标签更新(把所有小候选区域,按原来坐标贴回大图)。
S1候选区域提取:首先获取第n次伪标签迭代的二值标签;其次,提取伪标签中每个目标连通区域的质心,以质心为中心,裁剪出 d×d 大小的局部块(从 伪标签 里裁一块 d×d,从 模型预测图 里裁同位置同一块 d×d),并裁剪伪标签与预测结果中对应d×d的局部区域;最后,为突出目标区域并减少累积误差,使用自适应阈值从预测结果中提取局部候选区域,候选区域 = 预测图中 > 自适应阈值 的部分。(阈值=局部中值阈值=(预测图的最大值 + 最小值)× 0.5,是不是每个 patch 单独算?→ 是,所以叫自适应)
S2误检区域剔除:使用伪标签中目标区域的质心检查与候选区域的交集,剔除无交集的候选区域。
S3伪标签更新:首先还原所有优化后候选区域的位置,并使用最大值法将其合并为完整候选区域;随后更新伪标签:
Nn表示本次提取出来的候选区域(0/1 掩码),初始化为与点标签大小相同的零矩阵,Pn表示本次预测结果,Ln表示当前伪标签(旧),Ln+1表示新的伪标签,λ:衰减因子 = 0.97。
公式前半部分会把旧标签中不再是候选的区域衰减弱化,后半部分旧标签与新预测取平均,平滑更新(让正确区域扩张 / 精修),并施加衰减
这两个更新一粗一细、一个管样本选择一个管标签精修,配合得比较好。不过有一点:COU的"困难样本"定义完全依赖当前模型的检测结果,如果模型在某个阶段出了问题(比如学到了某种错误的模式),后面进来的样本筛选也会跟着出问题。论文里没有讨论这种错误传播的风险。
3.4 损失函数
对于SIRST探测任务,由于缺乏固有特征,很难精确定位目标区域。因此,本文引入了边缘增强困难挖掘(EEDM)损失来指导网络优化,它由边缘像素增强和困难像素挖掘两部分组成。
(1)边缘像素增强:以单幅图像为例,首先在二值伪标记中提取目标边缘轮廓。其次,利用二值交叉点损失得到每个像素的损失值,并形成损失矩阵。最后,我们对从标签中提取的边缘轮廓进行加权,并将该加权矩阵应用于计算得到的损失矩阵,得到边缘加权后每个点的损失值。
(2)困难像素挖掘:首先对每个点的损失值排序;其次获取大于等于中位数的损失值集合;最后计算困难像素的平均损失,得到最终损失。表达式如下:

一方面,边缘像素增强通过加权边缘像素的损失来增加对边缘细节的关注,从而增强了模型对重要特征的学习。另一方面,困难的像素挖掘通过滤除损失较大的像素,帮助模型更好地聚焦于难以检测到的目标区域,从而促进了模型在复杂区域的学习,防止了小目标被背景淹没。
3.5 衰减因子
如表 4 所示,与不使用衰减因子(λ=1)相比,使用衰减因子能够提升分割精度,IoU 提升 0.04%–1.48%,nIoU 提升 1.10%–2.92%。同时,在合理范围内使用衰减因子也会使Pd提升。本文最终将λ设为 0.97。
五、实验设置
5.1 数据集
实验采用四个公开的红外小目标检测数据集,分别为 SIRST3、NUAA-SIRST、NUDT-SIRST 与 IRSTD-1K,样本数量分别为 2755、427、1327 与 1001。本文按照文献划分 NUAA-SIRST 与 NUDT-SIRST 数据集,按照文献划分 IRSTD-1K 数据集。这些数据集可评估有限样本下的稳定性。SIRST3 是融合 NUAA-SIRST、NUDT-SIRST 与 IRSTD-1K 的多样本、多场景、多目标数据集,能够更有效地评估综合检测能力。与文献一致,本文将训练集标签处理为两类:粗点标签与质心点标签。
5.2 实现细节
实验设置:采用 AdamW 优化器,初始学习率为1e−3,批次大小设为 16,总训练轮数为 400,分为三部分:0–0.2、0.2–0.8、0.8–1.0。EPG 中裁剪的图像块尺寸为 20×20 像素。本文发现基于深度学习网络的模型在该任务中误检极少但漏检显著。由于本文策略会剔除误检区域,因此将Tf设为较大值以降低约束。为确保所有样本在模型增强阶段进入训练池,Tm初始阈值设为 0.2,并随轮数线性增加至 1。COU 与 FIU 的轮数周期设为 5。训练过程中,所有图像均执行归一化,并随机裁剪为 256×256 像素块作为网络输入。
5.3 部分实验结果




为验证模型预启动与精细化双更新策略的有效性,表 3 展示了详细的消融实验。从方案 1 与方案 2 可以看出,直接使用点标签训练会失效,而应用模型预启动后的网络性能大幅提升,验证了本文模型预启动理念与 EPG 策略的有效性。从方案 2–4 可以看出,单独使用 COU 或 FIU 均可显著提升性能。此外,从方案 2–5 可以看出,COU 与 FIU 结合使用时,实现了 “1+1>2” 的显著性能提升,充分验证了所提精细化双更新策略的有效性。
本文将 EEDM 损失与二元交叉熵损失、Dice 损失、Focal 损失进行对比。从表 5 可以看出,与其他损失相比,EEDM 损失效果最优。使用 EEDM 损失 IoU 提升 0.02%–5.00%,Pd提升 0.33%–2.73%。
“由易到难” 思路探讨
为何 “由易到难” 适配本任务?
本任务中目标区域通常尺寸极小、对比度低,对伪标签噪声高度敏感。单点监督进一步加剧了该挑战,稀疏标注提供的空间指导极少。直接在不可靠伪标签上训练不仅会导致性能下降,还会因误导监督产生语义漂移。“由易到难” 思路能够缓解该问题,因此本文首次将其系统引入单点监督红外小目标检测,并构建渐进式主动学习(PAL)框架。实验证明,本文 PAL 能够逐步引入更难样本并生成更精细的伪标签。针对本任务特性的自适应改进主要体现在简单样本伪标签生成(EPG)策略与精细化双更新策略。前者基于目标特性,通过局部亮度与边缘信息自动筛选 “简单样本”;后者结合点标签与模型反馈,调控样本引入与标签演化。

表6:MP-1 / MP-2:一开始就把所有样本(简单 + 难样本)全部扔进训练池训练。
标准 MP:一开始只放简单样本,难样本先不动。
为进一步探讨所提聚焦于由易到难学习的 PAL 框架,本文执行了详细实验。从表 6 中方案 1–6 可以看出,无论是否添加 FIU,初始阶段所有样本进入训练池生成的最终模型,性能远低于仅使用简单样本的模型。这进一步验证了本文初始阶段仅学习简单样本的模型预启动理念的有效性,如同新生儿应进行发音练习,而非被迫学习微积分。此外,从表 6 中方案 4 与方案 7 可以看出,与仅使用简单样本相比,基于当前模型能力逐步选取难样本加入训练池,会再次实现显著的性能提升。这进一步验证了由易到难学习思路的有效性。
这证明了本文提出的 模型预启动(Model Pre-start) 是真正有用的:
- 模型一开始能力为 0
- 必须先学最简单、最可靠、伪标签质量最高的样本
- 让模型先学会 “目标长什么样”
- 再去碰难样本
六、结论
本文针对单点监督下的细粒度红外小目标检测,提出创新的 PAL 框架,该框架驱动现有红外小目标检测网络渐进式、主动地识别与学习更困难的样本,实现显著的性能提升。
整个 PAL 的灵魂 “由易 → 难” 是真正有效的:
-
起步只学简单样本,使模型具备基础的任务专属学习能力(模型预启动)
-
模型变强后,逐步加入困难样本(COU)
-
同时不断优化伪标签(FIU),在这一过程中为缓解标注区域只扩张不收缩的风险,合理引入衰减因子,实现目标标注区域扩张与收缩的动态平衡。
更多推荐


所有评论(0)