原文链接:https://doi.org/10.1109/tgrs.2024.3376819

author={Maoxun Yuan and Xingxing Wei}

摘要

可见光(RGB)和红外(IR)图像上的目标检测作为一种新兴的解决方案,为全天候应用提供了可靠的检测手段,近年来受到了广泛的关注。在红外图像的帮助下,利用RGB-IR组合信息,目标检测器在实际应用中更加可靠和健壮。然而,现有的方法仍然存在着模态误校和融合精度不高的问题。由于Transform对不同特征之间的成对相关性建模能力很强,本文提出了一种新的校准互补Transformer(C2Former)来同时解决这两个问题。在C2Former中,我们设计了一个通道间交叉注意(ICA)模块,通过学习RGB和IR通道之间的交叉注意关系来获得校准和互补的特征。为了降低独立分量分析中计算全局关注度所带来的计算量,引入了自适应特征采样(AFS)模块来降低特征图的维度。由于C2Former在特征域中执行,因此它可以通过骨干网络嵌入到现有的RGB-IR目标探测器中。因此,构建了一个单级和一个两级目标检测器,这两个检测器都集成了我们的C2Former,以评估其有效性和通用性。通过在无人机和KAIST RGB-IR数据集上的大量实验,我们验证了该方法能够充分利用RGB-IR的互补信息,并获得了稳健的检测结果。

一、INTRODUCTION

图1。RGB-IR目标检测的两个主要问题。(A)RGB和红外模式之间的模式错误校准的一个例子。黄色和红色框分别表示IR图像和RGB图像中相同对象的注释。(B)MBNet输出的融合不精确的一个例子[19]。我们看到,红色方框中的融合特征比红外特征更差,这表明了特征融合的难度。

        目标检测作为计算机视觉领域的核心技术,被广泛应用于自动驾驶、视频监控、机器人等领域。随着卷积神经网络(CNN)的发展,目标检测技术在过去的几年中取得了长足的进步。由于这些探测器主要是为可见光(RGB)图像设计的,因此它们无法应对光照不佳(夜间)或各种天气条件(雨、灰尘和雾)[9]-[11]的挑战。由于这些原因,利用红外图像的探测器已被广泛采用作为稳健目标检测的另一种方式[12]-[14]。为了在全职检测任务中获得更好的性能,越来越多的工作[15]-[18]被研究通过结合可见光(RGB)线索和红外(IR)光谱来获得丰富的目标特征。

        然而,在RGB-IR目标检测中仍然存在两个主要问题[19]、[20]。(1)如图1(A)所示,其一是模式错误校准。现有的方法[16]、[21]-[24]通常假定RGB-IR图像对在几何上是完全对齐的,并且直接执行多模式融合方法。实际上,在图像配准算法之后,配对的图像只是弱对齐[25]、[26]。这是因为RGB-IR图像对由不同视场(FOV)和成像时间的不同传感器捕获,运动目标的位置可能不同步。(2)另一个问题是融合不精确,如图1(B)所示。在红外通道中,车辆的热辐射可能是探测器的重要线索,但在照度较低的情况下,RGB图像中没有这样的线索。RGB和IR的通道特征在物体的颜色、纹理和属性方面是不同的,因为它们是在不同的光谱波段捕获的,这给融合策略带来了很大的挑战。事实上,这两个问题是紧密耦合的,未对准的特征会直接导致融合的不精确。因此,这两个问题需要捆绑在一起,同时解决。

        最近,在RGB-T检测任务中,已经提出了一些解决这些问题的方法。张某等人。[25]和袁等人。[26]通过预测ROI头中两个模式之间的建议偏移量来解决模式错误校准问题。虽然这些实例级预测在一定程度上解决了对象未对准的问题,但它们不能保证两个通道方案中的特征完全对齐。此外,还采用了一些跨通道融合策略[10]、[15]、[27],通过简单的特征拼接或光照感知融合来解决融合不精确的问题。然而,RGB-IR通道特征之间的内在互补信息仍然没有被利用。更重要的是,上述方法没有考虑通道误校和融合精度不高的相关问题,而是主要针对其中的一个或单独解决,这会影响检测性能。

图2。ICA模块的图解结果。我们看到关注值与参考的RGB特征完全对齐,并且与原始的IR特征相比,增强了对象的区域,这对RGB特征更具互补性。

        本文借鉴transformer[28]中的自我注意机制,将上述两个问题表述为transformer框架,并针对这两个问题同时提出了一种新的基于校正互补的transformer融合方法C2Former。具体地说,对于一个通道中的每个特征点(查询向量),我们首先计算与另一个通道中的所有特征点(关键向量)的相似度得分,然后通过对另一个通道中的特征(值向量)的加权和来获得关注值。这些关注值具有两个性质:(1)它们包含了来自另一个通道的全局上下文信息,因此,可以被认为是比单个局部特征点对原始通道更好的补充特征。因此,我们可以简单地将这些关注值与原始特征点连接起来,进行有效的特征融合。(2)其他通道中最相关的特征点对注意值的贡献最大,这意味着由于相似性得分,校准是自动实现的。通过这种方式,我们在一个统一的框架内同时执行校准和融合操作。基于这一思想,我们设计了一个通道间交叉注意(ICA)模块。图2给出了ICA模块的图解结果。

        直接计算跨全局特征映射的关注度具有很高的计算成本。为此,需要对特征进行采样,以降低特征地图的维度。然而,由于错误校准,两种模式的统一采样策略可能会忽略有意义的特征。为了解决这个问题,我们提出了一种自适应特征采样(AFS)策略。具体地,我们通过偏差网络来预测各个通道相对于前景对象的偏移量,然后根据该偏移量针对不同的通道生成相应的采样策略。这样,我们就可以确保采样后的特征地图中重要区域的完整性。在实际应用中,首先通过AFS模块对给定的特征图进行下采样,然后由ICA模块进行处理得到互补特征,最后与给定的特征图进行级联得到融合特征。

        本文的主要贡献如下:

·提出了一种新的基于transformer的C2Former网络,用于同时解决RGB-IR目标检测任务中的通道误定标和融合精度问题。

·提出了一种同时对齐和融合RGB-IR特征的ICA模块,并提出了一种AFS模块来降低ICA的计算复杂度。这两个模块相互交互,可以端到端的方式组合在一起。

·为了评估C2Former的有效性和灵活性,我们构建了两个基于C2Former的RGB-IR目标检测检测器。在具有挑战性的RGB-IR目标检测数据集上的实验表明,该检测器达到了SOTA性能。

二、RELATED WORK

A. Multi-modal Transformers

        由于变压器模型[28]已显示出其捕获长期相关性的强大能力,因此也对多模式变压器[29]-[35]进行了探索。为了融合不同的通道特征,CMSA[36]将单词和图像输入到转换器中,以构建用于参考图像分割的联合多通道特征表示,而BRT[32]使用转换器,通过在图像和点云之间添加点到片投影来允许交互学习。类似地,Liu et al.[29]和肖等人。[33]分别设计了三重变换和特征交换变换来检测RGB-D图像中的显著目标。然而,这些方法通过直接级联或求和多个模式来执行特征融合来馈送变压器。它们没有考虑特征不对齐问题,这将导致融合特征的表示能力有限。

        与上述方法不同的是,Pixel-Bert[37]考虑了通道错位问题,并使用自监督学习在像素和文本级别对齐视觉和语言语义。此外,Wang et al.[38]利用层次化排列,探索文本-视频检索任务中细节和多样性的特点。最近,Wang等人提出了自己的观点。[39]通过在令牌级投影来自其他医疗设备的对准特征来聚合RGB和深度线索。尽管这些方法考虑了特征错位问题,但在融合过程中并没有进一步利用通道的互补性。

        上述方法试图利用转换器来解决多模式问题。然而,与这些多通道任务(文字-图像、文本-视频和点云-图像)相比,我们的C2Former是专门针对RGB-T目标检测任务而设计的,我们是第一个将转换器应用于该任务的人。由于RGB-T图像对中的通道误校和融合不精确问题是唯一且难以解决的,我们从自我注意机制的核心思想中得到启发,将这两个问题转化为转换器来建立它们之间的关联。因此,将这两个问题结合起来并同时解决,在RGB-T目标检测任务中具有重要意义。

B. Aerial Object Detection

        空中目标检测是指用旋转的包围盒来表示建筑物检测器,可以提供更准确的目标定位。夏等人[40]构建了一个面向标注的大规模目标检测基准,命名为DOTA。基于水平边界框构建探测器的现有方法受到一个锚中的多个感兴趣对象的困扰。因此,许多关于空中目标检测的研究已经被提出[41]-[46]来缓解这一问题。Ma等人。[41]构建R-RPN以使用旋转建议来检测空中目标。蒋等人现在R2CNN[42],它有一个水平感兴趣区域(ROI),它被用来预测水平和旋转的框。为了避免大量的锚,ROI Transform[43]被提出将R2CNN中的水平ROI转换为旋转ROI。为了加快探测器的推理速度,一些工作[47]-[50]探索了单级无锚定向目标探测器。R3Det[47]和S2a-Net[48]采用水平感受场和旋转锚点之间的对齐来获得更好的特征表示。最近,GWD[51]和KLD[52]分别被提出使用高斯瓦瑟斯坦距离和KL散度来优化包围盒的定位。

        近年来,利用RGB和红外图像进行空中目标检测也受到了广泛的关注。Sun等人。[53]为RGB-IR车辆检测提供一个名为DroneVehicle的基准数据集。在此基础上,提出了一种新的、轻量级的多光谱特征融合检测器CMAFF[54]。为了进一步提高夜间车辆检测性能,高等人。[55]提出了一种车辆检测驱动的RGB与红外图像融合方法--GF-Detect。此外,袁等人还提出了一种新的方法。[26]观察到无人机的弱未对准问题,并引入TSRA模块来校准两个通道特征。最近,文献[56]提出的辅助超分辨率分支被引入到RGBIR目标检测中,能够有效地区分小目标。在本文中,我们还构建了两流空中目标检测器,并结合我们提出的C2Former进行互补特征融合。

C. Multispectral Pedestrian Detection

        多光谱行人检测是行人检测的一个重要研究领域,取得了显著的研究成果。自从KAIST数据集[57]发布以来,越来越多的研究被提出通过利用对准的RGB和IR图像来提高探测器的性能。Wagner等人。[58]提出了第一种融合架构,利用多通道图像进行融合,提高了行人检测的可靠性。[18]和[16]提出了一种光照感知的融合体系结构来自适应融合RGB-IR特征。因此,Fusion CSPNet[59]被用来融合来自不同模式的特征,用于小规模行人和部分遮挡的情况。此外,周等人也提出了自己的观点。[19]通过设计一种称为DMAF的特征融合模块来解决通道不平衡问题。为了解决RGB-IR对象之间的弱不对准问题,ARCNN[25]在探测头上增加了一个额外的RFA模块来预测RGB-IR对象之间的偏移量。但是,RFA模块的通用性较差,只能应用于两级探测器。因此,我们提出了一种新的利用交叉注意机制的特征对齐模块,该模块可以应用于现有的各种检测器。

三、PROPOSED METHOD

图3.ICA模块流程。分别表示加法运算和点积运算。在通道归一化中,我们首先对一种通道的特征分布进行归一化,然后将CNN网络预测的均值和方差注入归一化后的特征分布中,实现特征分布的变换。

A. Inter-modality Cross-Attention (ICA)

        通道间交叉注意旨在识别对齐和互补的特征,这些特征将被进一步用于增强主干网络的特征表示。为了方便ICA模块(如图3所示),交叉注意机制被用来建立RGB-IR特征之间的交叉相关。具体地说,我们遵循自我注意机制,通过使用卷积层为q、k和v中的每个通道特征导出N个描述符。接下来,通过计算相似度矩阵,通过互相关对齐来寻找对齐的特征,并在软注意融合后得到每个通道的互补特征。为了减少不同通道描述符之间的差异,我们还设计了通道归一化过程。最后,我们对软注意输出的特征进行整形,并采用卷积层将其转换回原始的特征空间。设计的ICA模块极大地帮助C2Former找到RGB和IR特征之间的跨模式相关性。

Acquiring Feature Descriptors.

        假设独立成分分析模块的输入RGBIR特征为XRGB∈Rc×H×W和XIR∈Rc×H×W,我们首先使用输入特征分别生成查询q、关键字k和值v描述符。具体地说,我们对每个通道使用卷积层来生成描述符,并将其重塑为2D张量。定义了生成过程:

        其中分别是与查询、键和值关联的核大小为1×1的卷积。Q∈rhw×C、是重塑操作Γ(·)后的最终特征描述符。

Modality Normalization

        由于RGB和IR图像是在不同的光谱波段拍摄的,所以两幅图像之间存在着模式差异。因此,直接使用一种模式的图像特征来计算与另一种模式的图像特征的相似度分数并不是最优的。受[60]的启发,我们提出了通道归一化方法,将图像特征从一种通道转换为另一种通道的分布。图3右侧给出了通道正规化的过程,其中考虑了来自其他通道的平均值和方差。

        变换两个模态特征的过程是相同的。这里,我们以IR通道特征的处理为例进行通道归一化。我们首先将实例规格化[61]应用于IR特征XIR:

        其中,σIr和µIr是IIR的平均和标准偏差张量。我们还计算了xrgb的标准偏差µrgb和平均偏差σrgb,这将用于重新映射xIR分布。然后用三层卷积来预测两个可学习的参数张量βir和γir。之后,我们将σrgb和µrgb分别添加到γir和βir:

        其中Wb,Wg和Wd是核大小为3×3的卷积。最后,我们将γIR和βIR整合到归一化的IR特征˜IIR中,得到变换后的IR特征。同样,也可以获得变换后的RGB特征:

        因此,公式(1)中查询(qrgb和qir)描述符的最终生成过程修改如下:

Cross-Correlation Alignment

        为了校准RGB和IR通道之间的特征,我们计算了通道特征之间相对于彼此的注意图。我们首先通过矩阵乘法在两个模态特征之间进行内积运算。然后,对结果进行归一化处理,得到相似度得分。在此之后,其他通道中最相关的特征点(对齐特征)得分最高。通过上述过程,我们构造了每个通道的相似度矩阵M˜∈RHW×HW。具体地说,对于不同的通道描述符,我们在查询(例如QRGB)和关键字(例如KIR)之间应用矩阵乘法。RGB和IR矩阵可以表示如下:

        其中,Matmu1表示矩阵乘法,T表示矩阵的转置运算,√d表示缩放参数。然后,我们使用SoftMax层来获得列归一化(求和为1)互相关矩阵MRGb和MIR。在形式上,我们可以将这一过程定义如下:

其中,MRGB和MIR是N个描述符的列归一化(求和为1)相似矩阵。

Soft-Attention Fusion

        利用相似度矩阵M,可以根据权值动态补充特征,并加入上下文特征信息,使互补特征具有更强的鲁棒性。在该过程中,还在相似度矩阵M和值描述符之间利用矩阵乘法:

        然后,我们将的维度重塑为原始的特征格式,并采用卷积层从C2 Former获得高级互补特征表示。最终输出特征yrgb和yir可以表示如下:

        其中Wm和Wn表示各自模式的卷积层。

B. Adaptive Feature Sampling (AFS)

图4.AFS模块的结构,用于获取采样和粗对齐的特征。

        由于独立分量分析模块中矩阵乘法的计算复杂度很高,需要设计一个独立分量分析的前导模块来降低输入特征的维度。为此,我们引入了一种新的特征采样方法--自适应特征采样(AFS)。为了确保对齐特征对在采样过程中不会完全丢失,需要预测两个通道特征之间的粗略偏移量,然后根据偏移量对特征进行采样。因此,我们设计了基于可变形卷积的AFS模块[62]、[63]。AFS模块的结构如图4所示。首先,我们组合RGB-IR特征,并使用偏差网络(具有RELU激活的两个卷积模块)来预测它们的特征偏移量。基于这些偏移量,利用双线性内插运算分别从RGB和IR特征图中动态地采样粗对齐特征。

        具体地说,AFS的输入也是,因为AFS先于ICA模块对特征进行采样。我们首先对它们进行拼接,并利用1×1卷积WC来降低信道维度,从而得到新的特征映射XD∈RC×H×W,。请注意,为了简单起见,我们在表示法中去掉了批次维度。然后,我们使用偏差网络FD来产生两个模态之间的偏移量。由于∆p在训练期间可能波动,我们通过使用激活函数Tanh来缩放∆p的范围。因此,我们预测RGB-IR特征偏移量∆p,它可以表示为:

        然后,我们为RGB和IR模式生成参考点PrGB∈Rhs×Ws×2和Pir∈Rhs×Ws×2的网格,其中Hs=H/S和Ws=W/S是通过步长因子S从输入特征的大小向下采样的。然后,我们将这些点PrGB和Pir归一化到范围[−1,+1],其中(−1,−1)表示左上角位置,(+1,+1)表示右下角位置。最后,通过使用双线性内插采样函数∆(·;·)在预测位置选择来自两个模态的采样特征如下:

        最后,我们得到了的采样特征,它们被用作独立分量分析模块的最终输入。因此,方程式(1)中的描述符的维度和方程式(9)中的输出分别成为。为了使独立分量分析的输出尺寸(yrgb和yir)与输入特征(xrgb和xir)一致,方程(9)中的Wm和Wn成为具有上采样步长S的1×1反卷积[]。

C. C2Former-based Object Detectors

图5.基于C2Former的检测器的框架。我们的C2Former由独立分量分析和独立分量分析两部分组成,输入特征首先通过前置模块AFS进行特征降维,然后由独立分量分析模块输出对齐和融合后的特征。C2Former的输出通过加法运算被添加到相反的ResNet-50骨干网络中。为便于说明,我们没有在此框架中显示FPN结构。与上一次的分层操作一样,我们将两种模式的每一阶段输出的特征相加,得到多尺度特征,最后输入到FPN中。

        为了评估我们提出的C2Former,我们设计了一个包含C2Former的RGB-IR检测器框架,如图5所示。由于C2Former在主干网络中执行,因此在它之后可以使用不同的检测头。分别构造了基于S2A-NET[48]和Cascade R-CNN[65]的一级和两级检测器,分别用于定向检测和水平检测。在该框架中,使用ResNet-50[66]作为基线主干,并使用卷积层来减少RGB-IR特征的信道。每个C2Former的输入是两个通道的相应阶段的输出。然后将C2Former输出的互补特征加入到相对的骨干网络中,以增强通道特征的表示。为了保证不同模式特征的信息完整性,最后将两种模式的总和特征送入目标检测头。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐