论文阅读 | 红外小目标检测方向 2 | PQGNet
论文阅读 | 红外小目标检测方向第2篇| PQGNet
From Easy to Hard: Progressive Active Learning Framework for Infrared Small Target Detection with Single Point Supervision
PQGNet:面向红外小目标检测的感知查询引导网络
作者: Pingping Liu, Aohua Li, Yubing Lu, Tongshun Zhang, Ming Yang, Qiuzhan Zhou
主要机构:吉林大学
发表: TGRS2026
源码: https://github.com/PepperCS/PQGNet
写在前面:
这篇论文的方法部分实际上在做两件事:
第一,它认为红外小目标太小,直接做像素级检测很容易漏检,所以先用 PFCM 构造一个“区域感知图”,再让 PQGM 带着这个区域先验去查询各层特征,从而提升定位能力。
第二,它认为传统 U-Net 在下采样和上采样过程中会破坏高频边缘信息,所以在编码端用 MWHL 把最大池化和小波低频结合起来,在解码端用 HEWL 把浅层高频细节重新注入深层语义重建过程,从而改善边界恢复。
因此,PQGNet 的整体逻辑可以概括为:先用感知监督解决“小目标难定位”的问题,再用高频增强的小波重建解决“边缘难恢复”的问题。
摘要
红外小目标检测(IRSTD)在军事安全应用中至关重要。尽管 U 型架构已提升基线性能,但现有方法仍存在两大核心局限:1)微小目标空间感知不足导致目标定位丢失;2)深度特征重建中的边缘退化与语义模糊。为解决这些问题,本文提出 PQGNet,主要贡献如下:引入感知查询监督机制(PQSM),利用感知损失约束每个编码器层的空间特征学习,增强空间感知能力并优化特征融合引导;设计感知特征构建模块(PFCM) 生成增强感知特征以保留目标定位信息;提出感知查询引导模块(PQGM),通过跨注意力与跳跃连接实现全局与区域特征查询引导,优化目标特征提取。为缓解重建退化与语义模糊,区别于现有仅简单替换池化层的小波方法,本文设计最大池化 - 小波混合层(MWHL) 与高频增强小波层(HEWL),借助离散小波变换特性,利用浅层高频细节增强深度语义表征。在 NUDT‑SIRST、NUAA‑SIRST 与 IRSTD‑1K 数据集上的综合实验表明,PQGNet 检测性能显著超越当前最优方法,同时在计算复杂度与精度间保持优异平衡。
一、背景
红外小目标检测(IRSTD)作为红外搜索系统的核心技术,在现代国防、海上与空中监视等领域具有重要应用价值。IRSTD 的核心目标是在远距离、低能见度条件下,利用红外传感器识别并定位像素级微弱目标。然而,红外图像的固有特性给检测任务带来巨大挑战:强背景噪声—— 红外图像常包含大量背景杂波与传感器引入噪声,易掩盖目标;小目标特性—— 远距离成像使目标仅占少量像素,呈现信杂比(SCR)低、对比度弱、强度低、缺乏结构纹理等不利特征。
二、本文动机
A. 微小目标空间感知不足导致定位丢失
在 IRSTD 任务中,目标占比极小,显著削弱模型对微小目标的感知能力,引发目标丢失。以 ACM(CNN)、SCTransNet(CNN+Transformer)为代表的主流检测器均出现不同程度漏检,召回率偏低。
B. 深度特征重建中的边缘退化与语义模糊
传统 U 型架构采用最大池化下采样与双线性上采样,在深度特征重建中造成不可逆边缘模糊,高频细节丢失,严重阻碍小目标精细边缘重建。此外,浅层高分辨率特征与深层高语义特征间存在语义错位。红外小目标本身对比度低、边缘模糊,边缘退化与跨层信息传递不足相互加剧,成为当前 IRSTD 领域的核心难题。
现有模型因定位能力不足,常出现不同程度检测失败(漏检),说明直接对小目标进行像素级检测本身极具挑战性。本文假设:区域级检测(判断特定区域是否存在目标)是更易解决的子问题,能提供更鲁棒的定位线索。PQSM 的区域级召回率显著优于直接检测方法,验证了该假设。因此,有效衔接区域级与像素级检测可大幅提升小目标检测性能。本文重构检测任务:先确定子区域内目标存在性,引导模型融合全局与局部特征,缓解漏检并提升空间定位精度。
仅定位不足为证,深度特征重建阶段即便使用跳跃连接,目标边缘精准重建仍困难。标准 U 型架构的最大池化与双线性上采样会造成不可逆边缘模糊与高频细节丢失。为此,本文采用基于小波的下采样,在不损失细节的前提下保留结构表征,将浅层高频分量融入深层特征以实现有效边缘重建,使模型实现从粗定位到精边缘重建的由粗到精检测流程,最终提升整体检测性能。
三、创新点
- 提出 PQGNet 架构 —— 感知引导查询框架,创新设计感知查询监督机制构建感知特征,有效增强模型对红外小目标的表征能力。
- 受尺度感知损失与动态查询机制启发,设计感知查询监督机制(PQSM),凭借其固有的区域感知能力有效解决目标感知难题。PQSM 包含两大核心模块:1)感知特征构建模块(PFCM),在编码器各阶段施加目标感知约束,增强特征金字塔对目标的响应,生成增强感知特征;2)感知查询引导模块(PQGM),利用感知特征对关键区域内多级特征进行分层查询与聚合,建立聚焦于关键区域的优先语义关联。两模块协同作用,弥补模型捕获判别性小目标特征的不足,将全局建模聚焦为空间聚焦、感知引导的查询建模。
- 为解决边缘退化问题,本文引入小波分解与重建部分缓解该问题,但仅依赖小波低频分量处理深层特征仍不足。三阶小波变换仅保留低频分量,丢弃高频边缘信息,导致目标边界模糊、结构细节丢失,对红外小目标检测构成严重风险。现有小波方法未解决深层低频退化问题。因此,区别于纯小波采样方法,本文融合最大池化与小波变换的互补优势,设计最大池化 - 小波混合层(MWHL) 与高频增强小波层(HEWL),在深度重建阶段显式保留并增强高频边缘细节。
综上,本文提出的 PQGNet 显著提升红外小目标检测效能并抑制虚警。
四、方法
4.1 总体概述
如图 4 所示,PQGNet 由三个部分组成:编码器(encoder)、解码器(decoder)以及感知查询监督机制(Perceptual Query Supervision Mechanism, PQSM)。
其中,PQSM 又由两个相互关联的组成部分构成:感知特征构建模块(Perceptual Feature Construction Module, PFCM) 和 感知查询引导模块(Perceptual Query Guidance Module, PQGM)。
对于输入的一幅红外图像,编码器首先通过**残差卷积块(Res Block)**提取初始特征E1,
随后通过四层最大池化—小波混合层(MWHL)生成多尺度特征Ei (i=2,3,4,5),模型的特征通道数统一设为32。
然后,将多尺度特征Ei输入PQSM,在PFCM中,通过融合来自编码器的多尺度上下文信息生成引导特征,进而构建感知特征P,并利用感知损失Lper对其进行约束。
在PQGM中,用感知特征P作为查询基础,将它与编码器每一层的输出特征Ei进行交互。通过在预定义的感知区域中执行查询操作,得到增强特征Di(详见具体模块描述),数学公式定义如:
Di=Ei+PQGM(Ei,P),i∈[1,5] D_{i} = E_{i} + P Q G M \left(E_{i}, P\right), \quad i \in [ 1, 5 ] Di=Ei+PQGM(Ei,P),i∈[1,5]
也就是说,PQGM 的输出并不是直接替换原特征,而是以残差增强的方式叠加到原始编码器特征上。将 PQGM 生成增强特征Di 被送入解码器。经过解码处理后,得到输出特征Oi。
接着,对每一层输出Oi依次执行如下操作:利用 1×1卷积将通道压缩为 1,然后通过双线性上采样生成预测特征图 Mi
在训练阶段,论文分别计算 Mi与真实标注图 Y之间的 IoU 损失 和 二元交叉熵损失(BCE);在测试阶段,仅输出 M1作为最终检测结果。
4.2 编码器与解码器的设计
由于 U 形结构中存在多次下采样操作,目标特征在小波下采样后可能在低频信息中逐渐减弱甚至消失。为了解决这个问题,论文设计了两个核心结构:最大池化-小波混合层(MWHL) 和 高频增强小波层(HEWL)。MWHL 将最大池化与小波下采样结合,而 HEWL 则在小波上采样过程中重点增强高频信息。通过这样的设计,网络能够从深层特征中更有效地提取并重建目标的边缘结构特征。
(1)编码器——最大池化-小波混合层(MWHL)
如图 5(a) 所示,在该模块中,输入特征 Ei 同时经过两条并行分支:
一条分支使用最大池化层进行下采样;
另一条分支使用离散小波变换(DWT)下采样层,并且只保留其中的低频分量。
随后,将两条分支的输出沿通道维进行拼接,再经过一个残差块(ResBlock)进行特征融合和提取,最终输出下一层特征 Ei+1。其数学表达式为:
Ei+1=Resblock(Cat(MaxPool(Ei),DWTl(Ei))) E_{i+1} = R e s b l o c k \left(C a t \left(M a x P o o l \left(E_{i}\right), D W T_{l} \left(E_{i}\right)\right)\right) Ei+1=Resblock(Cat(MaxPool(Ei),DWTl(Ei)))
其中,DWTll表示使用 Haar 小波变换得到的低频信息。
一开始读这篇论文时对MWHL有一些疑问,记录一下
Q1.为什么编码器各层MWHL中的离散小波变换(DWT)下采样层只保留其中的低频分量?不提取高频信息吗?不提取高频信息,高频信息不久丢失了吗?
A:核心原因有两个,第一,对于红外小目标检测来说,高频里确实可能有目标边缘,但也同样包含大量背景噪声、杂波、亮点干扰,低频主要保留图像的整体轮廓、主体结构、平滑区域和主能量。 如果在编码阶段就把所有高频一路传下去,网络深层会受到很多噪声污染。这和作者的目标是矛盾的,因为作者想让编码器先形成更稳定的目标区域感知和语义表示。所以作者在编码器里先让 DWT 分支只保留低频,是想让这一支能够在下采样过程中保留稳定的图像特征。
第二,MWHL 不是“只有 DWT”,它还有 MaxPool 分支,因为 MaxPool 会保留局部最强响应,对小目标这种局部亮响应目标是有帮助的。
此外,编码器更适合抽象语义,解码器更适合恢复细节,所以作者把高频细节增强放在解码器里,是比较符合功能分工的。
同时,如果编码阶段直接保留全部高频,计算和融合都会更复杂,DWT 会产生四个子带:LL、LH、HL、HH。 如果每一级下采样都把高频一起保留,后续特征维度、融合复杂度、噪声控制难度都会上升。 而这篇文章显然更倾向于一种相对轻量、结构清晰的设计。
反正如果编码阶段只保留高频,纯 wavelet sampling 有风险:经过多次下采样以后,目标在低频里可能会逐渐减弱甚至消失,所以他们才把 max pooling 和 wavelet downsampling 结合起来。
综上,也就是说,用 DWT-LL 提供稳定结构表示,用 MaxPool 补充最强响应信息,可以避免小目标在纯低频传递中被削弱。
Q1.2: 那不提取高频信息,高频不是丢失了吗?
A:首先明确:仅依赖小波低频分量进行深层特征处理是不够的。第三层 DWT 只保留 LL 分量、丢弃高频边缘信息,会导致目标边界模糊、结构细节丢失。现有基于小波的方法往往没有很好解决这种深层低频退化问题。
因此,作者在MWHL中设置了两个分支,避免了只提取低频而丢失高频;并且在解码器中 HEWL 专门针对提取并增强高频。
- 虽然最大池化会保留局部响应最强的位置,一些强边缘、亮点、小目标峰值响应可能通过池化分支留下来。但是一部分高频信息仍会丢失,这也是出于一种取舍的结果,作者也通过消融实验验证了这种取舍对检测性能的提升是有帮助的。
(2)感知查询监督机制(PQSM)
PQSM 的目的是增强网络对微小目标的区域感知能力。该机制由两个顺序执行的模块组成:其一是 PFCM,用于从多尺度编码特征中构建感知先验;其二是 PQGM,用于将该先验重新注入到每一级编码特征中,通过查询引导实现特征增强。对应论文中“先粗粒度定位潜在目标区域,再利用这些区域先验引导特征提取”的总体思想。
感知特征构建模块PFCM
在 PFCM 中,五级编码特征 Ei 首先被映射到统一的感知网格上。该过程通过卷积核和步长均由 (H/(2i−1Pnum),W/(2i−1Pnum))决定的 Patch Embedding 完成,其中 Pnum=16。
在完成 Patch Embedding 后,所有投影后的特征沿通道维拼接,然后将其送入“Transformer Decoder”用于感知学习,并通过1X1卷积得到感知特征P。
用公式表示如:
P=Conv(TD(Cat{PatchEmbedi(Ei)∣i=[1,5]})) \mathbf{P} = \operatorname{Conv} (\mathrm{TD} (\operatorname{Cat} \{\mathrm{P a t c h E m b e d}_{\mathrm{i}} \left(\mathbf{E}_{\mathrm{i}}\right) | \mathrm{i} = [ 1, 5 ] \})) P=Conv(TD(Cat{PatchEmbedi(Ei)∣i=[1,5]}))
其中TD表示 “Transformer Decoder”(有消融实验来对其层数进行验证,结果表明2层最佳)
(注意:结合代码可知,这里作者所说的“Transformer Decoder”实际上是由多个轻量化自注意力块堆叠而成,而非标准的带编码器–解码器交互结构的 Transformer Decoder。每个自注意力块包含 q/k/v的通道投影、深度卷积局部增强、归一化、注意力聚合和残差连接。
感知查询引导模块PQGM
对于每一层特征 Ei,PQGM 利用全局感知引导特征 P 重新加权目标相关响应。具体而言,首先由原始特征Ei生成之矩阵 V;对输入特征进行平均池化层 AP,将其压缩到 16×16的感知分辨率,并由此生成查询张量 Q;键矩阵 K 也也有感知特征 P 通过卷积操作生成。
随后,Q与KT相乘,并通过softmax激活函数生成查询引导权重矩阵。将该权重矩阵乘以V,得到目标增强特征,最后与原始特征Ei相加,输出Di。数学表达式如下:
Qi=Conv(AP(Ei)),Vi=Conv(Ei),Ki=Conv(P)Di=Softmax{I(QKTγ)}Vi+Ei \begin{array}{l} \mathbf{Q}_{\mathrm{i}} = \operatorname{Conv} \left(\operatorname{AP} \left(\mathbf{E}_{\mathrm{i}}\right)\right), \mathbf{V}_{\mathrm{i}} = \operatorname{Conv} \left(\mathbf{E}_{\mathrm{i}}\right), \mathbf{K}_{\mathrm{i}} = \operatorname{Conv} (\mathbf{P}) \\ \mathbf{D}_{\mathrm{i}} = \operatorname{Softmax} \left\{\mathrm{I} \left(\frac{\mathbf{Q K}^{\mathrm{T}}}{\gamma}\right) \right\} \mathbf{V}_{\mathrm{i}} + \mathbf{E}_{\mathrm{i}} \\ \end{array} Qi=Conv(AP(Ei)),Vi=Conv(Ei),Ki=Conv(P)Di=Softmax{I(γQKT)}Vi+Ei
其中Conv为3×3卷积,AP为平均池化,I为实例归一化运算,γ定义为γ=c1/2的可选温度因子。
(3)解码器——高频增强小波层(HEWL)
HEWL 是解码阶段用于恢复高分Di辨率目标结构的关键模块,其核心思想是在深层语义表示与浅层高频细节之间建立耦合,从而改善边缘与轮廓恢复。
如图 5(b) 所示,第一层HEWL接收的是D5和D4作为输入,输出O4;之后每一层HEWL 接收上一层解码特征 Oi+1和对应的PQGM输出的当前层增强编码特征 Di 作为输入。
HEWL具体实现为:
一方面, 对当前层增强特征Di,首先对其进行 Haar 小波分解,将其分解为三个高频分量LH、HL、HH,和一个低频分量LL,仅保留三个高频分量。(实际代码中和图中表示的不太一样,没有直接对三个高频分量进行拼接,拼接在后续进行,详解后面描述)
另一方面,对来自更深层的解码特征Oi+1施加 交替通道注意力模块(Alternating Channel Attention, ALCA),其结构见图 5©。
受 SENet 的启发,作者提出的 ALCA (图5c)通在过融合多种统计信息来增强通道表征能力。具体而言,它同时聚合以下三种全局统计描述:
- 全局平均池化(GAP)
- 全局最大池化(GMP)
- 全局标准差池化(GSP)
从而构建更全面的通道描述符:
Ki=AC(GAP(Oi+1),GMP(Oi+1),GSP(Oi+1))Bic=Sigmoid(Conv(ConvG−C(BN(Relu(Ki))))) \begin{array}{l} K_{i} = A C \left(G A P (O_{i+1}), G M P (O_{i+1}), G S P (O_{i+1})\right) \\B_{i}^{c} = S i g m o i d \left(C o n v \left(C o n v_{G-C} \left(B N \left(R e l u (K_{i})\right)\right)\right)\right) \\ \end{array} Ki=AC(GAP(Oi+1),GMP(Oi+1),GSP(Oi+1))Bic=Sigmoid(Conv(ConvG−C(BN(Relu(Ki)))))
其中,Oi+1为输入特征;AC 表示交替通道拼接(Alternating Channel Concatenate)操作;BN为批归一化;K 为交替拼接后的特征;ConvG−C表示分组数设置为 1×1分组卷积;Conv表示普通的 1×1卷积;B为该模块输出的通道增强特征(作者这里用O表示,但跟HEWL的输出Oi+1和Oi不是一回事,因此这里改成了B,以便区分)。
接下来(看回图5b),ALCA 的输出同时输入到最大池化层GMP和平均池化层GAP中,两者结果在通道维拼接后,再经过卷积和 Sigmoid 激活,得到空间注意力图 S。
然后,利用空间注意力图 S 与这些高频分量逐元素相乘,以实现噪声抑制,如公式:
H~i(m)=Hi(m)⊙S+Hi(m),m∈{LH,HL,HH}. \tilde{H}_{i}^{(m)} = H_{i}^{(m)} \odot S + H_{i}^{(m)}, \quad m \in \{L H, H L, H H \}. H~i(m)=Hi(m)⊙S+Hi(m),m∈{LH,HL,HH}.
这里,ALCA 并不只是输出一个注意力图,而是直接将通道增强后的主干特征O与三路调制后的高频子带拼接为一个 4C 通道张量,并将其作为逆小波变换的输入。(Hi表示每一层的高频分量。)
随后,采用逆小波变IDWT换对该四分量输入进行重建,恢复出更高分辨率的特征表示:
Ri=IDWT(Bic,H~iLH,H~iHL,H~iHH) R_{i} = I D W T \left(B_{i}^{c}, \tilde{H}_{i}^{LH}, \tilde{H}_{i}^{HL}, \tilde{H}_{i}^{HH}\right) Ri=IDWT(Bic,H~iLH,H~iHL,H~iHH)
重建后的特征再经过卷积模块得到 Ui,再通过 1×1卷积和上采样得到当前层的辅助预测图Mi:
Mi=Up(Conv1×1(Conv(Ui))) M_{i} = Up \left(Conv_{1\times 1} \left(Conv \left(U_{i}\right)\right)\right) Mi=Up(Conv1×1(Conv(Ui)))
最后,将 Ui 与原始当前层增强特征 Di 在通道维上进行拼接,再通过残差卷积块输出当前层解码结果 Oi:
Oi=Resblock(Cat(Di,Ui)) O_{i} = R e s b l o c k \left(C a t \left(D_{i}, U_{i}\right)\right) Oi=Resblock(Cat(Di,Ui))
在解码阶段,每个 HEWL 都会生成一个辅助预测分支,因此网络依次得到四个辅助预测图 M4,M3,M2,M1,M1作为最终输出。
HEWL 的真实作用可以概括为:当前层增强跳连特征 Di提供高频细节,更深层输入特征 Oi+1提供语义主干,二者在 ALCA 与 IDWT 的配合下完成小波域联合重建,最后再通过与原始 Di 的融合得到当前层解码输出。
4.3 损失函数
论文在基础监督损失(Mi和GT之间的)之外,增加了感知监督损失(对P)。
论文实验部分给出的网络配置包括:基础通道数 C=32,感知区域划分尺度 Pnum=16,感知损失权重 λ=0.3,输入分辨率统一为 256×256。
对于感知监督分支,首先将真实标注图按 Pnum×Pnum的网格划分,构造区域级二值标签 Yper,然后对感知监督图施加 BCE 损失。感知监督输出记为 P,其过程可写为
Yper=Sign(AP(Pnum,Pnum)(Y)),Mper=Sigmoid(f1×1(P)),lper=LBCE(Mper,Yper). \begin{array}{l} Y_{per} = S i g n \left(A P_{(Pnum,Pnum)} (Y)\right), \\M_{per} = S i g m o i d \left(f_{1\times 1} \left(P\right)\right), \\l_{per} = L_{BCE} \left(M_{per}, Y_{per}\right). \\ \end{array} Yper=Sign(AP(Pnum,Pnum)(Y)),Mper=Sigmoid(f1×1(P)),lper=LBCE(Mper,Yper).
对于检测分支,采用多尺度 BCE 与 IoU 联合监督来约束各层预测图Mi与真实标签之间的一致性:
Mi=B(Sigmoid(f1×1(Oi)))(i=1,2,3,4)li=LBCE(Mi,Y)+LIoU(Mi,Y)(i=1,2,3,4) \begin{array}{l} \mathbf{M}_{\mathbf{i}} = \mathcal{B} (\mathrm{S i g m o i d} \left(f_{1\times 1} \left(\mathbf{O}_{\mathbf{i}}\right)\right)) (\mathrm{i} = 1, 2, 3, 4) \\l_{\mathrm{i}} = \mathcal{L}_{\mathrm{B C E}} \left(\mathbf{M}_{\mathbf{i}}, \mathbf{Y}\right) + \mathcal{L}_{\mathrm{I o U}} \left(\mathbf{M}_{\mathbf{i}}, \mathbf{Y}\right) (\mathrm{i} = 1, 2, 3, 4) \\ \end{array} Mi=B(Sigmoid(f1×1(Oi)))(i=1,2,3,4)li=LBCE(Mi,Y)+LIoU(Mi,Y)(i=1,2,3,4)
总损失可写为:
L=l1+l2+l3+l4+λlper L = l_{1} + l_{2} + l_{3} + l_{4} + \lambda l_{\mathrm{p e r}} L=l1+l2+l3+l4+λlper
五、实验
5.1 实验设置
数据集:NUAA-SIRST、NUDT-SIRST和IRSTD1K,分别由427、1327和1000幅图像组成。采用训练-测试分离配置标准来划分数据集。
训练细节:主要采用U型架构,编码端为MWHL,解码端为HEWL,通道数C设置为32。对于每幅图像,对其进行归一化,并均匀地将其分辨率调整到256×256。我们使用随机翻转和旋转来增强训练数据。
在NVIDIA GeForce RTX4070Ti上使用PyTorch框架进行了600个epoch的训练,batchsize为4。使用ADAM优化器,初始学习率为0.001。
5.2 部分实验结果
- Params(M):模型大小(越小越好)
- FLOPs(G):计算量(越小越好)
- Time(ms):推理速度(越小越好)
- mIoU(%):定位精度(越大越好)
- F-measure(%):综合性能(越大越好)
- Pd(%):检出率(越大漏检越少)
- Fa(10⁻⁶):虚警率(越小越好)


从表1和表2可以看出,PQGNet 保持高效的同时实现最优平均性能(平均 mIoU:82.81%,平均 F‑measure:90.22%),参数量仅 1.20M,计算复杂度 9.89G FLOPs,平均推理时间 6.01ms。相较于其他高性能方法(如 AGPCNet、UIUNet),PQGNet 模型复杂度显著更低、推理速度更快;相较于部分轻量方法(如 ACM、ALCNet),PQGNet 实现性能大幅提升。充分证明 PQGNet 在模型性能与计算效率间实现优异平衡,是兼具高精度与实用性的红外小目标检测解决方案。
图6:不同方法在三个数据集上的 ROC 曲线对比图
横坐标:FPR(假正率 / 虚警率Fa),把背景当成目标的概率 → 越小越好
纵坐标:TPR(真正率 / 检测率Pd),把真实目标抓到的概率 → 越大越好
ROC 曲线反映模型在不同阈值下的检测率与虚警率权衡关系,曲线越靠近左上角,检测性能越好。
包含 3 个子图:
(a) NUAA-SIRST
(b) IRSTD-1K
© NUDT-SIRST
作用:直观展示 PQGNet 在各种阈值下都比其他方法更优,曲线最靠左上角在各种阈值下都比其他方法更优,曲线最靠左上角(红线)。
表3:不同方法在两个固定虚警率(FPR=0.5e-4、FPR=1.0e-4)下的 AUC 值
指标:AUC(AUC = ROC ,曲线下面的面积,数值在 0~1 之间,曲线下面积,越大代表模型整体检测能力越强、越稳)
对比:所有 SOTA 方法 vs PQGNet
数据集:NUAA-SIRST、NUDT-SIRST、IRSTD-1K
作用:用精确数值证明 PQGNet 在低虚警下依然保持最高检测性能。


PFCM中"Transformer Decoder"层数与注意力头数 消融实验:
此外,本文深入分析PFCM 里的 Transformer Decoder关键超参数影响,结果总结于表 VII。实验表明,Transformer Decoder层数与注意力头数均存在最优配置点:层数设为 2 时,模型在参数效率(1.18M)、计算量(9.89G FLOPs)与综合性能(mIoU:96.73%,F‑measure:98.33%)间实现最佳平衡;注意力头数设为 2 时同样实现最优综合性能。超过该点增加层数或头数,模型复杂度大幅上升,但性能增益有限甚至下降。因此,本文最终选择Transformer Decoder层数 2、注意力头数 2 作为 PFCM 模块中 Transformer Decoder的最终设计,在保证高效率的同时实现最优目标检测精度。

图 8 是不同方法的显著图(saliency map)3D 可视化对比图
- 横轴 / 纵轴:图像空间位置
- 高度(Z 轴):响应强度 / 置信度
- 高度越高 = 模型认为这里越像目标
- 最右列:PQGNet 的感知特征热图 Mper 的 3D 图目标区域有强响应(感知能力比较强)、背景压得很平、几乎没有杂峰,背景抑制更彻底
- 其他方法的3D图背景杂波高、目标响应散、有毛刺、有虚警峰

泛化性实验:
为评估所提 PQSM 的泛化能力,本文在 NUDT‑SIRST 数据集上对六种先进红外小目标检测 U 型模型(ACM、ALCNet、MSHNet、MLPNet、SCTransNet)开展全面测试。如表 VIII 所示,所有模型集成 PQSM 后性能均显著提升,验证该机制的通用性。
5.3 讨论
本文所提 PQGNet 在红外小目标检测中表现优异,但仍存在优化空间,如图 9 所示,主要局限如下:
- PFCM 模块固定尺寸的感知区域,在目标尺度差异显著的复杂场景中存在限制。静态区域可能引入过多背景噪声,难以有效区分目标与非目标区域。未来需开发基于目标尺度先验的感知区域尺寸动态调整机制,增强多尺度特征聚焦能力。
- PQGM 模块存在潜在引导缺口。该模块虽能有效感知目标存在,但将感知信息转化为对检测头的精准引导仍可优化。未来需强化感知与检测阶段的语义对齐,设计更有效的引导架构弥补该缺口。
上述优化将增强 PQGNet 的场景适应性与特征引导精度,为红外小目标检测性能突破提供新路径。
六、结论
本文提出面向红外小目标检测的 PQGNet。具体而言,PQGNet 通过构建 PQSM 增强模型目标感知能力:首先由 PFCM 生成感知特征,再通过 PQGM 基于感知特征提升不同层级的目标感知能力。此外,设计 MWHL 与 HEWL 模块,借助小波变换与逆变换特性,结合多尺度细节信息,从深度语义维度有效实现目标边缘细节重建。为验证所提技术的有效性与优势,本文在三个公开数据集上开展有效实验验证。
更多推荐


所有评论(0)