《DAMSDet: Dynamic Adaptive Multispectral Detection Transformer...Adaptive Feature Fusion》论文分享(侵删)
原文链接:https://doi.org/10.1007/978-3-031-73383-3_27
author={Junjie Guo and Chenqiang Gao and Fangcen liu and Deyu Meng and Xinbo Gao}
摘要
红外可见光目标检测的目标是通过融合红外和可见光图像的互补信息来实现稳健甚至全天候的目标检测。然而,高度动态变化的互补特征和普遍存在的通道错位使得互补信息的融合变得困难。在本文中,我们提出了一种动态自适应多光谱检测转换器(DAMSDet)来同时解决这两个挑战。具体地说,我们提出了一种通道竞争查询选择策略来提供有用的先验信息。该策略可以动态地为每个对象选择基本的显著通道特征表示。为了有效地挖掘图像中的互补信息,适应不对准的情况,提出了一种多光谱可变形交叉注意模型,对红外和可见光图像的多语义层次特征进行自适应采样和聚合。此外,我们还进一步采用了DETR的级联结构来更好地挖掘互补信息。在四个不同场景的公共数据集上的实验表明,与其他最先进的方法相比,该方法具有显著的改进。
1 Introduction

图1:红外可见光目标探测中的两个典型挑战的图解。(A)三名行人代表不同的复杂互补特征。在该示例中,可见图像中的对象提供无用的干扰信息(红色)、部分互补信息(蓝色)和完全互补信息(绿色)。(B)未对准问题的一个例子,其中红外物体和可见光物体的地面真相出现明显错位。这种错位通常发生在红外可见图像中。我们提出了一种具有多光谱可变形交叉注意模块的多光谱变换解码器来同时解决这两个典型的挑战。
目标检测是计算机视觉中的一项基本任务,大多数研究工作都是基于包含详细目标信息的可见光图像,如纹理和颜色信息。由于深度学习的发展,目标检测技术取得了长足的进步。然而,它仍然受到低照度、烟雾、雾气等成像条件的挑战,这些条件会使目标变得非常模糊,进一步明显降低目标检测的性能。因此,红外图像被引入到目标检测任务中。与可见光成像不同,红外成像捕捉物体的热辐射,使其不受光照、烟雾和雾遮挡条件的影响。因此,红外成像即使在低照度、浓烟或雾的情况下也能很好地捕捉到物体,但细节的纹理和颜色信息会丢失。红外和可见光成像的这些互补特性不仅可以提高目标检测的性能,而且被认为是有希望实现全天目标检测的。因此,红外可见光目标检测近年来引起了广泛的关注[5,15,30,33,39,41]。
然而,现有的方法往往忽略了融合过程中复杂场景中遇到的通道干扰。对于一种模式的目标信号较差或不存在的情况,直接融合两种模式的信息会带来无用的干扰信息,从而导致特征混淆,从而降低目标检测的性能。例如,如图1(A)所示,烟雾中的行人完全消失,直觉上,最好的方法是抑制或丢弃该行人的可见信息。一些工作学习全局融合权值以适应特定场景,其中有代表性的是采用光照感知网络获得光照得分作为全局融合权值[12,33,41]。其他工作通过包围盒级别的语义分割[12,33,41]或感兴趣区域(ROI)预测[9,39,40]来学习局部区域融合权重。
实际上,由于成像原理的完全不同,红外-可见光图像中的互补特征随着特定场景和物体的不同而表现出很大的差异,如图1所示。特别是从图1(A)中,我们可以观察到三个行人具有明显不同的互补特征。如前所述,具有绿色边界框的边界框在两种模式中具有良好的互补信息,而具有红色边界框的边界框的边界框具有仅可用的红外信息。相比之下,具有蓝色边界框的边界框具有在两种模式中都可用的部分信息,这在实际应用中通常存在。这种情况使得现有的方法不能有效地融合特征,即使对于上述基于区域的加权融合方法,其中分割的或预测的区域通常比目标更大。因此,更细粒度的两模信息融合仍然是一个挑战。
红外-可见光目标检测的另一个重要挑战是通道失准问题。大多数特征融合方法假定这两种模式是很好地对齐的。然而,精确配准是困难的,因为红外-可见光图像通常表现出显著的视觉差异,并且并不总是在完全相同的时间戳拍摄[43]。因此,即使通过手动配准,对于同一个模式的两个模式的成像对象通常也不对准,如图1(B)所示。这可能会扰乱现有方法融合特征表示的一致性,影响最终的检测性能。AR-CNN[39,40]明确地学习了两种模式中对象的偏移量,以实现对象特征的对准。然而,这种方法在训练过程中需要额外的两个通道的成对边界框标注,这是耗时和劳动密集型的。
在本文中,我们提出了一种新的自适应红外可见光目标检测方法,其中包含一个带有多光谱可变形交叉注意模块的多光谱变换解码器,以同时解决由可变形交叉注意引起的上述两个挑战[42]。具体地说,在不同语义层次的双通道特征图上采用了自适应稀疏特征采样和权重聚合的有效策略。这种策略可以有效地融合细粒度的互补信息,即使在两个通道未对齐的情况下也是如此。由于细粒度信息融合和通道对齐这两个挑战是在一个模块中同时处理的,因此我们的方法比现有的通常单独处理它们的方法更有效。此外,与现有方法采用的一步融合策略不同,该方法中每个特定对象的信息融合发生在不同的语义层次上,使得互补信息得到充分的挖掘和利用。实际上,我们观察到,正如SEC中所讨论的那样,两种情态的互补信息也随着语义水平的不同而动态变化。3.3.这类似于我们对前面讨论的场景和对象的观察。因此,我们的自适应多层次融合更加合理。
为了在早期提供可靠的输入,我们设计了一种竞争查询选择策略,为每个对象选择主导的通道特征作为初始位置和内容查询,建立多光谱变压器解码器的基本显著特征表示,为后续处理提供有用的先验信息。为了逐步进一步开发更可靠、更全面的补充信息,本文采用了DETR[35]的级联层次结构。总的来说,我们的方法类似于人类的观察模式,它动态地聚焦于每个通道中的对象,并逐渐聚合两个通道的关键信息。
提出了一种新的红外可见光目标检测方法DAMSDet,该方法能够动态聚焦优势通道目标,并自适应地融合互补信息。
·提出了一种多通道初始化查询的竞争选择策略,动态聚焦于每个对象的优势通道,为后续的融合过程提供有用的先验信息。
·提出了一种多光谱可变形交叉注意模型,该模型能够同时自适应地挖掘不同语义层次的细粒度部分互补信息,并能适应通道错位的情况。
·在四个不同场景的公共数据集上的实验表明,与其他现有方法相比,该方法取得了显著的改进。
2 Related Work
红外可见光目标检测。以前红外可见目标检测的研究主要建立在单通道目标检测框架的基础上,该框架通常分为一级目标检测器,如较快的RCNN[28],以及两级目标检测器,如YOLO[25-27,31]。
为了融合红外和可见光图像的互补信息,Konig等人提出了一种新的融合方法。[10]介绍了一种完全卷积融合RPN网络,通过级联融合红外和可见光图像特征,得出了中途融合可以获得更好的融合效果的结论[16]。在此基础上,一些研究设计了基于CNN的注意模块,以更好地开发红外和可见光图像的潜在互补性[2,23,29]。此外,其他作品引入了基于变压器的融合模块,以捕捉红外和可见光图像之间更全局的互补关系[5,22,30,43]。
此外,还提出了直接融合图像特征的方法。一些工作采用光照信息作为全局权重来融合红外和可见光图像特征,或者对多帧检测结果进行后融合以减少干扰信息的影响[12,33,41]。考虑到不同区域的互补特征可能不同,一些研究引入了包围盒级别的语义分割[1,11,12,37,38]或感兴趣区域预测[9,39,40]来指导不同区域的融合。其他工作也利用区域的置信度或不确定性分数对多分支的预测进行后融合[14,15]。
为了解决情态失调的挑战,Zhang等人提出了一项新的研究。[39,40]开发了AR-CNN网络,并通过加入额外的成对边界框注释来学习对象未对齐,从而显式对齐了两个模态的特征。Kim等人。[8]还采用了多标签学习方法来适应未对准场景中的目标检测。
上述方法显著提高了红外可见光目标检测的性能。然而,这些方法进行的是整体图像特征融合或一步加权区域特征融合,难以在复杂场景中挖掘出完整的互补信息。相反,我们提出的方法将错位问题与互补特征融合联系起来,在多个语义层次上逐步自适应地挖掘特定对象的细粒度互补信息。
端到端对象检测器。
近年来,Carion et al.[3]首先介绍了基于变压器的端到端目标检测器,称为检测变压器(DETR)。它将目标检测看作一个集合预测问题,在训练过程中使用二进制匹配来直接预测一对一的目标集合。这极大地简化了对象检测管道,无需手动设计锚盒或使用NMS进行后处理。虽然DETR具有这些优点,但它存在训练收敛慢的问题,已经提出了许多DETR变体来解决这一问题。可变形的DETR[42]通过预测2D锚点和设计可变形的交叉注意模块来稀疏地采样参考点周围的特征来加速训练收敛。条件DETR[20]解耦了内容操作和位置操作,并提出了条件交叉注意来加速训练收敛。Efficient DETR[34]通过结合密集检测和稀疏集检测,提出了一种更高效的流水线。DAB-DETR[18]引入了4D参考点来逐层优化预测框。DN-DETR[13]在训练阶段引入了查询去噪,加快了训练过程和标签匹配效果。Dino[35]集成了上述工作,构建了一个强大的DETR检测框架。为了提高检测效率,RT-DETR[19]通过设计高效的混合编码器和采用IOU感知的查询选择策略,构建了一个实时的端到端目标检测器。
最近,基于DETR的多光谱行人检测进行了研究,设计了三个预测分支和一个实例感知的通道-平衡损失来对齐每个通道的贡献[32]。相反,我们的方法只有一个预测分支,并通过动态通道竞争查询选择策略来指导每个特定对象的特征融合。这种基于样本变化的动态制导策略对于复杂多变场景下的红外可见光目标检测具有更好的效果。
3 Method

图2:DAMSDet概述。我们的DAMSDet包括四个主要组件:用于提取特征的两个特定于通道的CNN主干,用于编码特征的两个特定于通道的高效编码器[19],用于选择初始对象查询的通道竞争查询选择模块,以及用于挖掘补充信息和优化查询的多谱变换解码器。
3.1 Overview
我们的DAMSDet的概述如图2所示。我们的方法包含四个主要组件:两个特定于通道的CNN主干、两个特定于通道的高效编码器、通道竞争查询选择和多光谱转换器解码器。给出一对红外和可见光图像,我们首先使用两个特定于通道的CNN主干和两个特定于通道的高效编码器分别提取和编码它们的特征。随后,编码的特征被展平、拼接,并输入到通道竞争查询选择模块。该模块选择显著的通道特征作为初始对象查询。接下来,这些特定于通道的对象查询进入多光谱转换器解码器,该解码器通过级联的解码层使用红外和可见光特征图的多个语义级别对其进行提炼。最后,通过检测头映射这些精化的目标查询,得到所有目标的包围盒和分类分数。
高效编码器结合了Transformer和CNN,遵循RT-DETR的结构,显著降低了计算复杂性[19]。在下文中,我们将详细阐述所提出的通道竞争查询选择策略和具有多光谱可变形交叉注意模块的多光谱变形解码。
3.2 Modality Competitive Query Selection
DETR中的对象查询是一组可学习的嵌入,包含对象的内容和位置信息。这些查询用作对象特征表示,其与解码器中的图像特征序列交互,并通过预测头部映射生成边界框和分类分数。除了将对象查询设置为可学习嵌入之外,还有一些方法可以将Top-K Score特征用作初始对象查询[34,35,42]。可学习对象查询很难优化,因为它们没有明确的物理意义[19]。在红外和可见光图像中,两个通道特征之间存在差距,进一步使可学习对象查询的优化复杂化。因此,从编码后的特征映射中选择目标查询更适合红外可见光目标检测任务中互补特征的动态变化。
具体地说,我们将红外和可见光通道的编码特征序列拼接在一起,并将它们送入线性投影层,以获得特征点得分。从该组合特征表示中,我们选择Top-K评分特征作为初始对象查询。这些Top-K分别来自红外或可见光特征的检测头,并且每个特征表示特定于其各自模式的对象实例。这种方法可以定义为:
![]()
其中,z表示K个所选特征的集合,I和V分别表示平坦化的编码红外和可见特征序列。
如前所述,红外或可见光图像可能包含无用的干扰信息,这可能会混淆网络。我们竞争性地选择特定于通道的特征来构建每个对象的显著特征表示。该方法有助于防止在早期阶段引入来自另一个通道的干扰,并提供有用的先验信息,以便在后续解码器中改进查询,强调查询的对象表示应优先于其起源的通道。此外,我们还使用了IOU感知分类损失[19,36]的优化策略来进一步提高所选特征的质量。

图3:通道竞争查询选择结果的可视化。红点表示在相应的通道图像中选择的高分查询,而蓝点表示得分较低的查询。红色方框表示高分查询所代表的对象。
Effectiveness analysis. 为了观察我们的通道竞争查询选择策略在网络中的性能,我们将所选通道特定的初始查询在配对图像上的位置和分数可视化。具体地说,我们映射这些选定的特征以获得参考点的坐标,这些参考点被进一步投影到红外或可见光图像上。如图3所示,可视化显示不同的对象实例由不同的主要通道特征显著地表示。这一选择结果与我们的直觉一致,表明该方法在不同的条件下动态地为每个对象选择主要的检测方式。更详细的定量结果和分析发表在Sec. 4.4.
Redundant queries. 我们还观察到,红外和可见光图像中存在指向同一对象的冗余查询。然而,由于DETR的一对一匹配优化模式和应用于解码器中所有特定于通道的查询的自我注意机制,网络有效地消除了这种冗余信息。为了进一步解决这一潜在问题,我们在训练期间引入了噪声查询学习[13,35]策略,以便于学习每个对象的最佳通道匹配。
3.3 Multispectral Transformer Decoder

图4:多光谱变压器解码器(图中省略去噪训练组)和多光谱可变形交叉注意模块的结构。
图4显示了多光谱变换解码器的细节。在每一层中,特定于通道的对象查询首先进行多头自关注,以获得上下文信息并减少冗余。随后,我们的多光谱可变形交叉注意模块使用多语义红外和可视特征来精炼这些特定于通道的查询。此外,我们使用4D锚盒来约束多光谱可变形交叉注意模块的采样范围,并通过级联解码器层迭代地精化查询和锚盒。具体来说,在D层多光谱解码器中,我们从第q个特定于通道的查询
映射到DTH层中,得到精化的4D参考点
。其过程可以描述如下:
![]()
其中d∈{2,3,.。。,D},mlp由两个线性投影层组成,σ表示Sigmoid函数,σ−1表示逆Sigmoid函数,
是初始化的锚盒。初始锚点设置与可变形DETR中的两阶段法一致[42]。在多光谱可变形交叉注意模块中,这个精细化的4D参考点作为后续采样的参考位置约束,用于对多语义红外和可见光特征图进行采样。
Multispectral Deformable Cross-attention module.
在可变形DETR[42]中,通过稀疏采样在特征地图上聚集关键特征,并将其扩展为多模式形式,实现自适应红外和可见光特征融合。多光谱可变形交叉注意模块的详细结构如图4所示。具体地说,我们通过MLP层映射4D参考点来定位嵌入。在将特定于通道的查询特征与位置嵌入相结合后,使用两个线性层来分别预测两个通道中多语义特征图上的采样偏移量和聚集权重。最后,对采集到的多语义红外和可见光特征通过聚合权重进行聚合。由于这种方法能够独立地预测红外和可见光模式下的采样位置偏移,网络仍然可以关注未对准图像对中未对准对象的特征。
给定输入的多语义红外和可见光特征图
,我们使用Bq的归一化中心点作为2D参考点ˆPq。我们定义多光谱可变形交叉注意模F如下:

其中m∈{1,2}表示可见光和红外通道,h表示注意头,L表示输入特征的语义级别,k表示采样点。
分别表示L特征语义层次中的第k个注意权重和采样点,以及m情态中的第h个注意中心。将注意权值Amhlqk归一化为
。函数
将ˆPQ缩放到L的语义层特征图,函数
将预测偏移量约束在bq的范围内,从而集中在对象周围的信息,降低了优化的难度。
Effectiveness analysis.

图5:不同解码层中不同语义层次的特征采样可视化。不同颜色的点表示不同语义层的采样结果,其中蓝色、绿色和红色分别表示低层、中层和高层语义特征图上的采样点。颜色鲜艳且分数较大的人表示关注度相对较高。(A)可见图像中的绿色框表示对齐的边界框,表示每个通道中的采样点集中在正确的实例位置。(B)被背景和烟雾遮挡的物体往往主要集中在后续解码层的红外模式上。(C)在良好照明条件下的对象和那些在红外模式中不太容易区分的对象往往主要集中在后续解码层的可见模式上。
为了观察这种特征融合方法的有效性,我们在不同的解码层中的不同语义层次上可视化了两个通道中采样的位置和权重,如图5所示。结果表明,随着解码器层的加深,我们的方法倾向于自适应地关注红外通道的低层语义特征和可视通道的附加高层语义特征。这一结果是合理的,因为红外情态携带的信息较少,并且可以提供可靠的低级语义信息,例如基本轮廓和形状,而具有更多信息的可视情态可以另外提供更抽象的高级语义信息,例如更可靠的对象类别的上下文关系。此外,我们观察到这些点能够适应未对准的场景,并自适应地聚焦于对象的关键信息,例如边缘信息,这对定义对象的边界很重要。不同解码层的采样位置和权重分布的差异也验证了级联结构对可靠互补信息挖掘的有效性。
3.4 Loss Function
我们的模型的训练损失遵循DETR-like detectors,其定义为:
![]()
其中,Lcls是RT-DETR之后的IOU感知分类损失[19],Lbox由L1损失和用于包围盒回归的广义IOU损失组成,Ldn是去噪训练的损失[35]。此外,我们还计算了各解码层的损耗作为辅助优化损耗。
4 Experiments

表2:与FLIR对齐的数据集的比较。

表3:LLVIP数据集的比较。

图6:关于M3FD(a,b)、FLIR(c,d)和VEDAI(e,f)的代表性结果。红色倒置的三角形表示检测结果与地面真实情况不符。将这些结果可视化时,置信度阈值设置为0.5。
更多推荐


所有评论(0)