本文核心贡献如下:

  • 提出傅里叶角度对齐(FAA):首次利用傅里叶旋转等变性和矩形频谱能量垂直于主轴的性质,在频域中估计目标主方向并进行特征对齐,为旋转目标检测提供新视角。

  • 设计即插即用模块:提出FAAFusion(颈部方向对齐融合)和FAA Head(检测头预对齐+残差融合),分别解决跨尺度方向不一致性和分类与回归的任务冲突。

  • 显著提升性能:在DOTA-v1.0、DOTA-v1.5和HRSC2016上取得新SOTA(如DOTA-v1.0达78.72% mAP),且在高IoU阈值下优势更明显。

  • 轻量高效:模块计算开销小,可无缝集成至主流旋转检测框架。

    博主简介

AI小怪兽 | 计算机视觉布道者 | 视觉检测领域创新者

深耕计算机视觉与深度学习领域,专注于视觉检测前沿技术的探索与突破。长期致力于YOLO系列算法的结构性创新、性能极限优化与工业级落地实践,旨在打通从学术研究到产业应用的最后一公里。

🚀 核心专长与技术创新

  • YOLO算法结构性创新:于CSDN平台原创发布《YOLOv13魔术师》、《YOLOv12魔术师》等全系列深度专栏。系统性提出并开源了多项原创自研模块,在模型轻量化设计、多维度注意力机制融合、特征金字塔重构等关键方向完成了一系列突破性实践,为行业提供了具备高参考价值的技术路径与完整解决方案。

  • 技术生态建设与知识传播:独立运营 “计算机视觉大作战” 公众号(粉丝2.2万),成功构建高质量的技术交流社群。致力于将复杂算法转化为通俗易懂的解读与可复现的工程代码,显著降低了计算机视觉的技术入门门槛。

🏆 行业影响力与商业实践

  • 荣获腾讯云年度影响力作者创作之星奖项,内容质量与专业性获行业权威平台认证。

  • 全网累计拥有 8万+ 垂直领域技术受众,专栏文章总阅读量突破百万,在目标检测领域形成了广泛的学术与工业影响力。

  • 具备丰富的企业级项目交付经验,曾为工业视觉检测、智慧城市安防等多个关键领域提供定制化的算法模型与解决方案,驱动业务智能化升级。

💡 未来方向与使命

秉持 “让每一行代码都有温度” 的技术理念,未来将持续聚焦于实时检测、语义分割及工业缺陷检测的商业化闭环等核心方向。愿与业界同仁协同创新,共同推动技术边界,以坚实的技术能力赋能实体经济与行业变革。

 原创自研系列, 26年计算机视觉顶会创新点

《YOLO26魔术师》

 原创自研系列, 25年计算机视觉顶会创新点

《YOLOv13魔术师》

《YOLOv12魔术师》

《YOLO11魔术师》

《YOLOv8原创自研》

《YOLOv5原创自研》

《YOLOv7原创自研》

《YOLOv9魔术师》

​《YOLOv10魔术师》 ​

应用系列篇:

《YOLO小目标检测》

《深度学习工业缺陷检测》

《YOLOv8-Pose关键点检测》

23、24年最火系列,加入24年改进点内涵100+优化改进篇,涨点小能手,助力科研,好评率极高

《YOLOv8魔术师》

 《YOLOv7魔术师》

《YOLOv5/YOLOv7魔术师》

《RT-DETR魔术师》

0.原理介绍

论文:Fourier Angle Alignment for Oriented Object Detection in Remote Sensing

摘要:在遥感旋转目标检测中,主流方法存在两个瓶颈:检测器颈部的方向不一致性和检测头的任务冲突。利用傅里叶旋转等变性,我们引入了傅里叶角度对齐,该方法通过频谱分析角度信息,并将主方向对齐到特定方向。随后,我们提出了两个即插即用模块:FAAFusion 和 FAA Head。FAAFusion 作用于检测器颈部,将高层特征的主方向对齐到低层特征后进行融合。FAA Head 作为一个新的检测头,将 RoI 特征预对齐到规范角度,并在分类和回归之前将其与原始特征相加。在 DOTA-v1.0、DOTA-v1.5 和 HRSC2016 上的实验表明,我们的方法能显著提升先前工作的性能。特别地,在单尺度训练和测试下,我们的方法在 DOTA-v1.0 数据集上达到了 78.72% mAP 的新最先进结果,在 DOTA-v1.5 数据集上达到了 72.28% mAP,验证了我们的方法在遥感目标检测中的有效性。

1. 引言

与通用目标检测相比,遥感中的目标(如船舶、飞机和车辆)通常朝向任意方向 [2, 12, 49]。对于旋转目标检测,定向边界框是一种流行的解决方案,它同时预测每个目标的类别和方向 [42, 57]。

最近在 ROD 方面的进展集中在设计旋转敏感卷积 [35, 41, 54, 56]、修改骨干网络 [1, 25, 48] 或检测颈部 [26, 30, 32, 38, 39],以及优化角度回归损失 [15, 40, 46, 47]。在这项工作中,我们提出了傅里叶角度对齐,它利用频域来估计和对齐目标方向,以增强现有的 ROD 方法。如图 1 所示,我们的即插即用模块可以应用于主流的 ROD 架构,以处理两个常见的瓶颈:颈部中的方向不一致性和检测头中的任务冲突。

当给出不同层级的特征时,如图 2 所示,传统的 FPN [28] 使用简单的逐元素加法或拼接来融合它们。然而,一方面,高层特征通常具有强语义但空间细节模糊,因此其方向是粗略和低频的 [4]。另一方面,低层特征具有清晰的边缘和纹理,因此携带精确的高频方向线索。当这两种类型的特征直接融合时,它们的方向信号常常发生冲突。这种不匹配在融合特征中产生噪声,降低了角度预测的准确性。

由于同一个 RoI 特征必须服务于两个不同的任务,分类和角度回归常常发生冲突。如图 3 所示,分类需要旋转不变特征,因为无论方向如何,飞机都应始终被识别为飞机。然而,回归需要旋转敏感特征,即当目标旋转时特征必须改变。强制单个特征同时满足这两个目标会导致一种折衷:特征既不是完全不变的也不是完全敏感的。这限制了模型准确预测类别和角度的能力。

我们的 FAA 包含两个轻量级模块:FAAFusion 和 FAA Head。嵌入在 FPN [28] 中的 FAAFusion 首先使用傅里叶分析从低层特征估计主方向,然后在融合前旋转高层特征以使其与低层特征对齐。这确保了跨尺度方向的一致性。FAA Head 作为一个新的检测头,对于每个 RoI 特征,它在频域中估计主方向并将 RoI 特征旋转到规范方向,然后将旋转后的特征加回到原始特征上。对齐后的特征将有利于分类任务,而原始特征有助于定位和方向回归。

我们在三个具有挑战性的基准数据集上评估我们的方法:DOTA-v1.0 [12]、DOTA-v1.5 [12] 和 HRSC2016 [33]。在 Oriented R-CNN [44] 框架内,我们选择了 ResNet50 [19]、LSKNet-S [25] 和 StripNet-S [48] 三个代表性骨干网络。我们的方法在 DOTA-v1.0 [12] 上将 mAP 提高了 0.68%、1.00% 和 0.63%;在 DOTA-v1.5 [12] 上提高了 0.37%、2.02% 和 1.73%;在 HRSC2016 [33] 上提高了 2.17%、1.81% 和 1.23%,证明了频域方向估计是旋转目标检测的一个强大且实用的工具。

我们的主要贡献可总结如下:

  • 我们提出了傅里叶角度对齐,一个即插即用的框架,利用频域分析来估计和对齐目标方向,从而增强现有的旋转目标检测方法。

  • 我们通过 FAAFusion 模块解决了检测器颈部的方向不一致性,该模块通过方向显式对齐局部特征,以确保跨尺度的方向语义一致性。

  • FAA Head 模块替换了检测头,将 RoI 特征预对齐到规范方向,并与原始特征融合,有效缓解了分类与角度回归之间的冲突。

2. 相关工作

本节简要回顾了推动该领域发展的最相关的研究和方法,希望为本文的贡献奠定基础。

2.1. 遥感目标检测

鉴于遥感图像中的目标可以朝向任意方向,目标检测器必须超越通用检测的标准输出,额外编码边界框的方向。主流方法可总结如下。一些研究关注骨干网络的改进,用精心设计的模块替换 ResNet [19] 中的常规卷积块。ARC [35] 引入了自适应旋转卷积模块,应用多组旋转核来提取不同方向的特征。GRA [41] 使用分组旋转和分组注意力来减轻不期望方向上旋转卷积核产生的噪声。一些研究专注于构建新的骨干网络。作为第一个将 RE-Net 引入定向目标检测网络的方法,ReDet [17] 提出了 ReResNet 作为旋转等变骨干网络,以固有地保留方向信息。LSKNet [25] 通过引入大选择性核机制,自适应地捕获航拍图像中多尺度和任意方向目标的上下文信息。PKINet [1] 通过采用可学习参数化的大卷积核,增强了对航拍图像中具有极端长宽比和变化方向的目标的感知能力。Strip R-CNN [48] 采用条带卷积结构来有效建模航拍图像中细长目标的几何特征,提高了对高长宽比旋转目标的检测性能。凭借其骨干网络强大的特征提取能力,这些方法极大地提升了检测性能。

其他研究集中于颈部和检测头设计,以更好地适应定向边界框预测。虽然像 PANet [32] 和 BiFPN [39] 这样的通用颈部增强了跨尺度特征融合并有利于多尺度检测,但它们并未显式地建模方向。相比之下,顶级方法将方向感知集成到检测头或 RoI 处理阶段:RoI Transformer [11] 通过学习通过轻量级空间变换器将轴对齐的 RoI 特征转换为定向特征,在回归前有效地对齐特征。Oriented R-CNN [44] 采用了两阶段头,将角度预测与框细化解耦,以低计算开销实现了高精度。S2A-Net [18] 引入了一个无锚点的单阶段头,带有一个 AlignConv 模块,该模块根据预测的角度动态采样特征。关键的是,在 OBB 参数化和回归损失方面已经取得了显著进展:GWD [46] 将 OBB 建模为二维高斯分布,并使用 Wasserstein 距离作为损失,而 KLD [47] 则用 Kullback-Leibler 散度替代,以确保尺度不变性并提高训练稳定性。尽管取得了这些令人印象深刻的成果,但这些方法主要作用于空间域特征,未能直接从特征表示本身显式地编码或学习旋转信息。

2.2. 频域分析

频域分析在计算机视觉中有着悠久而丰富的历史。早期方法 [22, 31, 43, 51] 主要利用傅里叶特性来设计旋转不变的手工特征提取器,然后将这些特征用于下游任务。近年来,随着深度学习的兴起,研究人员 [10, 23, 24, 50, 52] 开始将傅里叶变换显式地集成到神经网络架构中,以利用其全局感受野和在几何变换下的固有特性。例如,FcaNet [36] 用频率-通道注意力机制取代了全局平均池化,在频谱域中建模长程依赖关系,显著提升了图像分类和目标检测的性能。最近,一系列工作 [8, 9] 强调了显式频率建模在密集预测中的关键作用。空间频率调制 [6] 通过调制-解调方案减轻了下采样过程中的混叠,以保留高频细节。FreqFusion [4] 将特征分解为低频频和高频分量,以共同增强类内一致性和边界清晰度。频率自适应膨胀卷积 [5] 基于局部频率内容动态调整膨胀率和核频谱响应,以平衡感受野大小和有效带宽。而像 FDAM [7] 这样的模块通过高频注意力补偿来抵消 Vision Transformer 的低通偏置。总的来说,这些进展表明,显式频谱建模为提高特征提取性能奠定了强大的基础,从而为定向目标检测提供了新的视角。

3. 方法

在本节中,我们首先介绍我们的公式和动机。接着,我们将详细描述我们的傅里叶角度对齐方法。然后,我们将介绍 FAA 在检测器不同位置的应用,即 FAAFusion 和 FAAHead,这将在 3.3 和 3.4 节中详细说明。

3.1. 公式与动机

旋转目标检测。设输入图像为 I(x),x = (x,y)⊺。对于一个水平目标检测器 D_HBB,输出是一组带有类别信息的轴对齐边界框:

其中 (x_i, y_i) 是框的中心,h_i 和 w_i 是框的高度和宽度,c_i 是框中目标的类别。

对于一个旋转目标检测器 D_OBB,输出是一组包含一个旋转角度的旋转边界框:

其中 x_i, y_i, w_i, h_i, c_i 与 HBB 中的相同,θ_i 是旋转角度。

傅里叶旋转等变性。设 I(x) 表示空间域中的一个信号。其频谱为:

其中 ω = (u, v)⊺,F 表示傅里叶变换。接下来,考虑将 I 逆时针旋转角度 ϕ 绕原点旋转,我们知道旋转后的图像将是 I_ϕ(x) = I(R_{-ϕ} x),其中 R_ϕ 是二维旋转矩阵:

然后,假设旋转后的频谱是 F_ϕ(ω)。通过变量替换,最终可以推断出:

这意味着如果空间信号旋转了 ϕ,其频谱也将旋转 ϕ,如图 4a 所示。

矩形的频谱对齐。假设 I_rec(x) 表示空间域中的二维矩形函数,且 x = (x, y)⊺。具体地,

其中 0 < b ≤ a,使得矩形的主轴与 x 轴对齐。其频谱为:

其中 ω = (u, v)⊺ 表示频域坐标。通过可分离性,

其中 sinc(z) = sin(πz)/(πz),矩形的功率谱为:

由于 a > b,sinc(2au) 的主瓣比 sinc(2bv) 的窄。因此,频谱能量沿 v 轴的衰减比沿 u 轴慢。因此,在高频区域,主要的频谱能量沿着 v 轴,即垂直于矩形主轴的方向,如图 4b 所示。

动机。这些观察揭示了一个基本性质:目标方向可以从频域中可靠地估计。这提供了一种直接且原则性的方法来处理方向,而当前仅依赖空间特征的检测器在很大程度上忽略了这一点。

具体来说,在颈部,低层特征包含清晰的边缘和纹理,编码了精确的方向线索,而高层特征带有强语义但方向模糊。简单地将这些特征相加会混合方向不一致的信号,损害角度预测。相反,我们可以使用从低层特征在频域中估计的方向来显式地对齐高层特征再进行融合,从而确保跨尺度的方向一致性。

类似地,在检测头中,同一个 RoI 特征需要同时支持从旋转不变特征中获益的分类和需要旋转敏感特征的角度回归。这产生了固有的矛盾。通过在频域中估计 RoI 的主方向,我们可以将特征旋转到一个规范姿态。得到的对齐特征对分类来说几乎是旋转不变的,而原始的 RoI 特征有助于回归,这可以有效地解耦这两个冲突的任务。

3.2. 傅里叶角度对齐

我们提出了傅里叶角度对齐,其主要进展如图 5 所示。一般来说,FAA 可以分为两步:傅里叶角度估计和角度对齐。

傅里叶角度估计。给定一个方形特征图 X ∈ R^{H×H} 作为输入,FAA 估计其主方向并执行旋转对齐。首先,FAA 对输入特征图应用二维离散傅里叶变换以获得其频谱表示:

其中 F(·) 表示二维傅里叶变换算子。

为了便于后续的极坐标转换,FFA 将零频率分量移动到频谱的中心,这通过乘以一个相位因子来实现:

为了更方便地估计主方向,FAA 将中心化的频谱 F_c 从笛卡尔坐标 (u, v) 转换为极坐标 (ρ, θ),然后计算相应的能量谱:

其中 u(ρ, θ) = H/2 + ρ cosθ, v(ρ, θ) = H/2 + ρ sinθ, ρ ∈ [0, ρ_max], θ ∈ [0, 2π)。

基于我们的先验知识,对于一个矩形目标,其频谱能量集中在特定的方向附近。为了鲁棒地估计这个主方向,我们沿着径向方向对极坐标下的幅度谱求和,从而得到一个一维的角度能量分布函数 E_θ(θ):

目标的估计主方向是 E_θ(θ) 达到最大值的方向。为了方便,我们将角度范围限制在 [0, π):

角度对齐。在获得估计的主方向后,FAA 将原始特征图旋转一个特定的参考角度,以使主方向与该
其中 R_{Δθ}(·) 表示关于图像中心的二维旋转算子。Δθ = θ₀ - θ̂,θ₀ 是参考角度。

3.3. FAAFusion

FAAFusion 替换了 FPN [28] 中的传统逐元素加法。设高层语义特征为 Y_{l+1} ∈ R^{C × H × W},低层细节特征为 X_l ∈ R^{C × 2H × 2W}。

首先,如同原始 FPN [28],我们对高层特征 Y_{l+1} 进行上采样以匹配低层特征 X_l 的空间分辨率:

为了降低计算成本,我们对 Y_{l+1}^u 和 X_l 都应用 1×1 卷积,将其通道维度投影到一个共同的中间尺寸 C_mid,然后我们使用 unfold 操作来获得局部特征:

其中 N = 2H × 2W 是空间位置的总数,每个局部特征 p_i^h, p_i^l 对应于空间位置 i。对于从 1 到 N 的 i,我们首先估计低层特征的主方向:

然后我们使用 θ_i^l 作为目标方向来旋转高层特征。旋转后的高层特征为:

在处理完所有位置 i=1,...,N 后,我们使用 fold 操作重建对齐后的高层特征图,并应用 1×1 卷积将通道维度恢复为输出大小,得到 Y{l+1}^{recon}:

最后,通过将低层特征、上采样后的高层特征和重建的对齐特征相加,得到第 l 层的融合特征:

3.4. FAA Head

FAA Head 作为一个新的检测头,直接替换 Oriented R-CNN [44] 框架中的原始头部。它以 RoI 对齐后的特征 F_roi 作为输入。对于每个 RoI 特征,我们应用 FAA 将其对齐到一个规范方向,在我们的实验中具体为 0°:

得到的特征 F_inv 是旋转不变的,因此更有利于分类。

为了保留在对齐过程中可能丢失的细粒度空间线索,我们将原始 RoI 特征作为残差加回:

然后我们将 F_final 展平为一维向量,并通过两个共享的全连接层:

最后,得到的特征向量 z 被送入独立的分类和回归分支,分别用于类别预测和定向边界框的细化。

4. 实验

在本节中,我们首先介绍实验设置,包括所使用的数据集和实验实现方式。然后,我们将在这些数据集上展示我们的结果。本节末尾是我们的分析,包括消融研究、我们的 FAA Head 与最新方法的有效性比较以及高 IoU 性能分析,这实际上是一个现实问题。

4.1. 实验设置

数据集。我们在三个流行的遥感目标检测数据集上进行实验:DOTA-v1.0 [12]、DOTA-v1.5 [12] 和 HRSC2016 [33]。

  • DOTA-v1.0 [12] 是一个大规模遥感目标检测数据集,包含 2,806 张图像、188,282 个实例和 15 个类别。该数据集由训练集、验证集和测试集组成,分别包含 1,411、458 和 937 张图像。

  • DOTA-v1.5 [12] 是 DOTA-v1.0 的扩展版本,为 DOAI Challenge 2019 发布。它包含相同的 2,806 张图像,但有 403,318 个实例和 16 个类别,包括对车辆实例的细化标注和一个名为“集装箱起重机”的新类别。此外,这个迭代版本中微小实例的数量大幅增加,更具挑战性。

  • HRSC2016 [33] 是一个用于遥感图像中船舶检测的数据集,包含 1,061 张图像和 2,976 个船舶实例,通过水平边界框和方向角进行标注。这些图像分为训练集、验证集和测试集,分别包含 436、181 和 444 张图像。

评估指标。遵循先前的工作 [1, 25, 44, 48],我们采用平均精度均值作为两个 DOTA [12] 数据集的评估指标。对于 HRSC2016 [33],我们根据先前的工作 [41] 使用 PASCAL VOC2007 [13]/VOC2012 [14] 指标,报告 AP50、AP75 和 mAP。

实现细节。所有实验均在 Openmmlab 开发的 MMRotate [55] 工具箱下实现。遵循先前的工作 [1, 25, 44, 48],对于 DOTA-v1.0 [12] 和 DOTA-v1.5 [12],输入尺寸设置为 1024×1024;对于 HRSC2016,输入尺寸设置为 800×800。对于 DOTA-v1.0 [12] 和 DOTA-v1.5 [12],在 trainval 集上训练 16 个 epochs。评估第 12 到第 16 个 epoch 的模型在测试集上的表现,并选择性能最佳的作为最终结果。对于 HRSC2016 [33],训练 36 个 epoch,并使用最后一个权重进行测试。在训练过程中,我们使用 AdamW [34] 作为优化器,权重衰减设置为 0.05。对于 HRSC2016 [33],初始学习率设置为 0.0004;对于两个 DOTA [12] 数据集,初始学习率设置为 0.0001。批量大小为 2,所有训练和测试均在单个 RTX 3090 GPU 上执行。

4.2. 主要结果

我们首先将我们的 FAAFusion 和 FAA Head 添加到 Oriented R-CNN [44] 框架内的三个代表性最先进方法中,并在上述数据集上进行评估。在这些方法中,ResNet50 [19] 是最经典和流行的骨干网络,不仅广泛应用于目标检测任务,也用于其他计算机视觉任务。LSKNet-S [25] 是近期在检测和分割方面都最强大的模型,而 StripNet-S [48] 是最新的最先进方法。

在 DOTA-v1.0 [12] 上的结果。如表 1 所示,我们选择 ResNet50 [19]、LSKNet-S [25] 和 StripNet-S [48] 作为骨干网络,并将我们的 FAAFusion 和 FAA Head 添加到模型中。特别是对于已设计 StripHead 的 Strip R-CNN [48],我们将其 Strip Head 替换为我们的 FAA Head。基于这些模型,我们的方法分别实现了 +0.68%、+1.00% 和 +0.63% 的新提升。与当前最先进的方法 PKINet [1] 相比,我们使用 StripNet-S [48] 的结果实现了新的 SOTA 结果 78.72%,mAP 高出 0.33%。

在 DOTA-v1.5 [12] 上的结果。类似地,我们选择 ResNet50 [19]、LSKNet-S [25] 和 StripNet-S [48] 作为骨干网络,并将我们的 FAAFusion 和 FAA Head 添加到模型中。对于 Strip R-CNN [48],我们像之前一样将其 Strip Head 替换为我们的 FAA Head。如表 2 所示,基于这些模型,我们的方法分别实现了 67.14%、71.57% 和 72.28% 的新结果,每个模型分别提高了 0.37%、1.73% 和 2.02%。与当前两阶段 SOTA 检测器 PKINet [1] 相比,我们使用 LSKNet-S [48] 的结果实现了新的 SOTA 结果 72.28%,mAP 高出 0.81%。

在 HRSC2016 [33] 上的结果。如表 3 所示,我们将我们的 FAAFusion 和 FAA Head 集成到三个代表性的定向目标检测器中:Oriented R-CNN [44]、LSKNet [25] 和 Strip R-CNN [48]。遵循这些工作,我们在 PASCAL VOC2007 [13] 和 VOC2012 [14] 的评估协议下报告 AP50。此外,为了比较模型在更严格标准下的检测性能,我们还报告了 COCO [27] 风格的 AP75 以及 mAP 结果。在 VOC2007 [13] 指标下,我们的方法在所有基线上持续提升了性能,分别实现了 2.17%、1.81% 和 1.23% 的 mAP 增益。在 VOC2012 [14] 指标下,我们的方法为 Oriented R-CNN [44] 提升了 1.72% 的 mAP,为 LSKNet [25] 提升了 2.34%,并为 Strip R-CNN [48] 保持了 0.43% 的更高竞争性能。

4.3. 分析

两个提出模块的消融研究。为了衡量 FAAFusion 和 FAA Head 的有效性,我们在 Oriented R-CNN [44] 框架上以 LSKNet-S [25] 为骨干网络进行了消融实验。我们在 FPN [28] 中融合第三层和第二层特征时,将逐元素加法替换为我们的 FAAFusion,并将原始检测头替换为 FAA Head。FAA Head 遵循 Oriented R-CNN [44] 框架的检测头设计,在分类和回归之前使用两个共享的全连接层。但与原始第一个全连接层的输出维度设置为 1024 不同,我们的 FAA Head 的输出维度设置为 1024+256。如表 4 所示,我们评估了 FAAFusion 和 FAA Head 在 DOTA-v1.0 [12] 数据集上的影响。结果表明,FAAFusion 和 FAA Head 分别将 LSKNet [25] 的性能提高了 0.42% 和 0.78%,这意味着我们的两个模块都对结果有贡献。

与最新的检测头工作比较。为了评估我们 FAA Head 的有效性,我们在三个代表性骨干网络上验证了检测头:ResNet50 [19]、LSKNet-S [25] 和 StripNet-S [48]。具体来说,我们选择最新的检测头 Strip Head [48] 以及原始检测头作为比较对象。如表 5 所示,在所有这三个检测器中,FAA Head 取得了最高的 mAP 值。与 Strip Head [48] 相比,FAA Head 以非常接近的参数数量实现了更高的 mAP,但计算成本低得多。这些结果表明,FAA Head 能够在不大幅增加计算成本的情况下持续提高检测性能。

高 IoU 性能分析。在当前旋转船舶检测的评估协议中,AP50 的结果几乎饱和。方法之间的差异很小,掩盖了真正的精确定位能力。一旦 IoU 阈值上升到 0.7 以上,主流检测器的性能急剧下降,表明它们的几何建模仍然粗糙。然而,船舶检测等任务高度要求严格的边界框拟合和准确的方向,因为微小的错位可能导致后续的识别或测距误差。因此,在高 IoU 范围内测试鲁棒性消除了宽松指标带来的人为优势,并直接检查模型在精度关键场景中的表现是否良好。受此考虑,我们计算了从 0.70 到 0.90 的高 IoU 阈值的 AP,并绘制了曲线。如图 6 所示,我们的方法的优势在更高的 IoU 阈值下变得更加明显,展示了其在精确方向建模方面的卓越能力。

5. 结论

在这项工作中,我们提出了傅里叶角度对齐,利用傅里叶旋转等变性和矩形的频谱对齐,以更好地建模旋转目标检测任务中的方向线索。我们从理论上证明了矩形目标的频谱能量集中在垂直于其主轴的方向上,并利用这一见解在频域中估计主方向并据此对齐特征。我们将 FAA 集成到颈部和检测头中,设计了 FAAFusion 和 FAA Head,它们以最小的计算开销增强了跨尺度的方向一致性,并提高了 RoI 特征的旋转不变性。在三个基准数据集上的实验证明了我们的方法在遥感目标检测中的有效性。未来,值得探索 FAA 在其他视觉任务中的泛化能力,例如实例分割或遥感变化检测,并研究更高效的频域对齐策略以实现实时应用。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐