论文题目:MSCK-Net: Multiscale Chinese Knot Convolutional Network for Dim and Small Infrared Ship Detection(基于多尺度中国结卷积网络的微光红外舰船检测)

期刊:IEEE TRANSACTIONS ON GEOSCIENCE AND REMOTE SENSING

摘要:在军民融合应用中,遥感红外舰船探测对海上安全和交通管理至关重要。然而,现有方法的检测精度和鲁棒性仍然受到数据集约束的限制,包括规模小、目标尺寸分布窄、目标稀疏、场景特异性高。为了解决这些问题,我们整合了公开可用的数据集,构建了红外船舶检测数据集(IRShip)——一个包含27138张图像的相对大规模的红外船舶检测数据集,显著提高了数据的规模和多样性。我们进一步设计了一种复制-泊松混合(CP-PB)离线数据增强方法,并引入了一种密集的一对一(dense - O2O)在线增强策略,该策略提高了对复杂背景和规模变化的适应性,减轻了稀疏目标的问题,提高了数据集的实用性和模型的鲁棒性。本文提出了一种多尺度中国结卷积网络MSCK-Net,用于探测弱小红外舰船目标(dsists)。具体来说,我们提出了一种新的中国结卷积(CKConv)方法,该方法可以更好地对准小目标的局部特征和舰船目标的形态特征,从而显著增强底层特征的表示。基于CKConv的多尺度结块(MSK-Block)和Stem-ck模块提高了深度特征传输效率和dsists的全局建模,显著提高了检测性能。在IRShip、nudtsist - sea、ISDD、IRSDSS和maritimsist上的大量实验表明,MSCK-Net-M达到了最先进的性能,在IRShip上的AP50、AP75和AP分别为82.5%、53.1%和50.9%,显著优于现有的20个普通目标探测器和6个红外目标探测器。在四个子数据集上进行的泛化实验进一步验证了该方法的有效性和鲁棒性。

代码和数据集可从https://github.com/sjxxrh/MSCK-Net获得


MSCK-Net:用"中国结"思想破解红外舰船检测难题

一、研究背景与动机

在现代海洋监测和国防系统中,基于遥感红外图像的舰船检测是一项核心技术。红外成像具备全天时、全天候、抗干扰能力强的优点,但也面临严峻挑战:

  • 目标极小且暗弱:卫星视角下舰船目标往往仅占图像中几个像素,信噪比低,纹理细节严重缺失;
  • 背景复杂多变:海浪、云层、港口建筑等都会引起误报;
  • 尺度变化大:从港口密集的小型船只到开阔海面上的大型舰船,目标尺度跨度极大;
  • 数据集瓶颈:现有公开数据集规模小、场景单一、泛化性差,严重制约深度学习模型的训练与部署。

本文将上述目标统称为 DSIRSTs(Dim and Small Infrared Ship Targets,暗小红外舰船目标),并围绕数据和模型两个维度提出了系统性解决方案。


二、现有方法的核心问题

2.1 数据集层面

【此处配 Fig. 1:雷达图,展示各数据集目标尺度分布差异及DFine-n模型跨数据集泛化性能对比】

如 Fig. 1 所示,NUDT-SIRST-Sea、ISDD、IRSDSS、Maritime-sirst 四个代表性数据集在目标尺度分布上存在显著差异,各有侧重但互不兼容。更严峻的是,在单一数据集上训练的模型在其他数据集上测试时,性能会急剧下降——这直接暴露了现有数据集泛化性极差的致命缺陷。

具体而言,现有数据集存在以下问题:

  1. 规模偏小:最大的 NUDT-SIRST-Sea 也仅有 5808 张图像;
  2. 目标尺度分布窄:各数据集覆盖的目标大小范围有限,难以反映真实场景的复杂性;
  3. 背景样本占比过高:IRShip 集成后发现,无目标的纯背景图像仍高达 69.5%,严重破坏前景/背景分布平衡;
  4. 场景高度特异:在某一场景(如近岸)训练的模型难以泛化到另一场景(如开阔海面)。

【此处配 Table I:NUDT-SIRST-Sea、ISDD、IRSDSS、Maritime-sirst 及 IRShip 的统计数据对比表】

2.2 模型层面

在特征提取方面,现有卷积设计各有短板:

卷积类型 优点 缺点
标准 3×3 卷积 局部空间连续性好 感受野小,对细长结构无效
大核卷积(LKC) 感受野大 缺乏方向敏感性,引入冗余背景响应,过平滑
条带卷积 方向特征提取强 无法聚合正交方向信息

此外,大多数多尺度改进工作集中在特征融合阶段,而忽视了低层特征提取本身的质量——DSIRSTs 的弱特征在深层传播时本就极易衰减,若低层提取不力,后续融合再精妙也于事无补。


三、本文的核心贡献

本文从数据模型两个维度提出了四项创新:

  1. 构建大规模综合数据集 IRShip,并设计 CP-PB 离线增强Dense-O2O 在线增强
  2. 提出新型低层特征提取模块 CKConv(中国结卷积)
  3. 基于 CKConv 构建核心模块 MSK-BlockStem-ck
  4. 集成上述模块,提出完整的轻量高效检测网络 MSCK-Net

四、IRShip 数据集

4.1 构建思路

作者将上述四个公开数据集进行标准化整合:

  • Maritime-sirst(原始分辨率 256×256):将 4 张随机图像拼成 512×512 马赛克图,并将掩码标注转换为边界框;
  • NUDT-SIRST-Sea:修正部分漏标和错标,掩码标注转为边界框;
  • ISDD / IRSDSS:直接缩放至 512×512。

最终 IRShip 包含 27,138 张图像,其中训练集 16,283 张、验证集 2,720 张、测试集 8,135 张,共标注 36,341 个舰船目标

【此处配 Fig. 2:IRShip 及各子数据集的目标分布统计直方图(目标背景比、目标面积、目标亮度、单图目标数量四个维度)】

4.2 IRShip 的六大特性

① 场景与背景多样性

【此处配 Fig. 3:IRShip 场景多样性示例图,包含陆地、内河、近岸、离岸、港口、岛屿等不同场景和天气条件】

IRShip 涵盖港口、内河、近海、远海、岛屿等多种地理场景,以及高温、低温、薄雾、浓云、海风等不同天气条件,提供了极为丰富的训练样本。

② 虚警类型多样:薄云降低舰船/背景对比度,浓云轮廓与舰船相似;港口集装箱、陆地边缘、海面波浪杂波均可能触发虚警。

③ 目标更小:IRShip 中目标/背景面积比仅为 0.00061%,NUDT-SIRST-Sea 更低至 0.000029%,远低于现有数据集,约 45.6% 的目标属于小目标。

④ 目标尺度全覆盖:整合不同传感器分辨率(特别是宽视场空基红外图像),IRShip 覆盖从微小到大型的全部目标尺度范围。

⑤ 亮度分布均衡:IRShip 中 53% 为暗目标(亮度 < 25),同时兼顾了 ISDD/IRSDSS 中的中等亮度目标,对温度变化具有更强鲁棒性。

⑥ 稀疏性问题:尽管无目标样本仍占 69.5%,但通过下文介绍的 CP-PB 增强策略,可有效将目标稀疏分布转变为更均衡的分布。

4.3 CP-PB 离线数据增强

【此处配 Fig. 8:CP-PB 数据增强方法示意图】

传统 Copy-Paste(CP)方法将目标随机粘贴,容易出现目标嵌入云层、陆地等不合理情况,反而增加训练难度。本文提出的 CP-PB(Copy-Poisson Blend) 方法改进了三个环节:

  1. 目标裁剪:随机扩展标注框以保留少量周边背景,保持局部上下文;
  2. 粘贴区域筛选:仅选取像素强度为 0~35 的低亮度真实海洋区域,并约束粘贴目标间 IoU < 0.1,防止重叠;
  3. 泊松融合:通过求解泊松方程 $\min_f \iint_\Omega |\nabla f - \nabla g|^2$,在保留源区域梯度的同时匹配目标背景颜色,消除人工边界伪影,使合成图像更自然。

4.4 Dense-O2O 在线数据增强

DETR 框架中的 DFine 采用一对一(O2O)匹配策略,每个目标仅分配一个正样本,在目标稀疏时收敛极慢。本文引入 Dense-O2O 策略,通过四阶段调度器在线生成额外正样本:

阶段 Epoch 范围 策略 学习率
1 1 ~ 4 禁用复杂增强,简化注意力学习 0.0004
2 5 ~ 48 启用 Mosaic + Mixup,增加正样本 0.0004
3 48 ~ 148 仅保留 Mosaic,学习真实背景 0.0008
4 148 ~ 160 关闭所有增强,稳定训练 0.0008

五、MSCK-Net 模型设计

5.1 整体架构

【此处配 Fig. 4:MSCK-Net 整体结构图,包含 MSK-Net 骨干、MSFF-Net 颈部和 Decoder & Head 三大组件】

MSCK-Net 由三部分组成:

  • MSK-Net(骨干):Stem-ck → Patch Embedding → 4 个阶段的 MSK-Block,空间分辨率逐步下采样 32 倍,输出 P1~P4 多尺度特征图;
  • MSFF-Net(颈部):RepNCSPELAN4 模块进行上下采样与跨尺度特征交互;
  • Decoder & Head:沿用 D-FINE 设计,采用 FDR(细粒度分布精化)和 GO-LSD(全局最优定位自蒸馏)提升定位精度,不增加参数与训练成本。

模型提供三个规模变体:

【此处配 Table II:MSCK-Net-N/S/M 三个变体的参数配置表(输入输出、通道数、MSK-Block 数量、CKConv 核尺度等)】

5.2 CKConv:中国结卷积

$k_i \in {3,5,7}$

【此处配 Fig. 5:CKConv 结构示意图,展示三条并行分支及其融合方式】

设计灵感:中国传统结艺中,绳结通过水平、垂直方向的相互交织,在中心汇聚形成稳定结构。CKConv 将这一几何思想映射到卷积设计中。

结构组成:CKConv 由三条分支并行计算后融合:

  • 分支1(水平条带)$1 \times k_i$ 卷积(),捕获水平方向特征,经填充保持空间尺寸;
  • 分支2(垂直条带)$k_i \times 1$卷积,捕获垂直方向特征;
  • 分支3(方形核):标准 $3 \times 3$卷积,维持局部空间连续性。

分支1与分支2的输出逐元素相加,再经$1 \times 1$点卷积调整通道维度:

$F_{4-k_i}^{(h,w,c_2)} = \left(\text{Add}\left(F_{2-k_i}^{(h,w,\frac{c_2}{2})}, F_{3-k_i}^{(h,w,\frac{c_2}{2})}\right)\right) \otimes W_{4-k_i}^{(1,1,c_2)}$

设计优势

  • CrissCross-Square 结构:水平+垂直方向感知舰船细长形态,方形核保持局部一致性,两者互补;
  • 中心汇聚效应:周边弱像素信息向目标中心汇聚,有效增强弱目标的特征响应;
  • 多尺度正交条带$k_i$取 3、5、7 时对应不同长宽比的舰船目标,适应性更强;
  • 轻量设计:引入分组卷积,在最大化感受野的同时控制参数量。

可视化验证

【此处配 Fig. 6:下采样特征图可视化对比(CKConv vs 标准Conv),包含256×256、128×128、64×64三个尺度的特征图,以及1D频谱曲线和灰度梯度等高线图】

如 Fig. 6 所示,在 256→128→64 的下采样过程中,标准卷积在 64 尺度时已基本丢失 DSIRSTs 的特征细节;而 CKConv 在该分辨率下仍能保持显著的特征响应,具有更广泛的空间激活覆盖。频谱分析进一步表明,CKConv 在 128 尺度的所有频段均获得更强响应,证明其对边缘、纹理等结构信息的保留能力更强。

5.3 MSK-Block

【此处配 Fig. 7:MSK-Block 结构图,展示 IBN 子块与 CGLU 前馈子块的连接关系】

MSK-Block 包含两个残差子块:

① CKConv 子块(IBN 结构)

  • 首先用 $1 \times 1$卷积展开通道维度至 $c_2$,引入 GELU 激活增强非线性;
  • 并行执行$k_i=3,5,7$的三个 CKConv 操作;
  • 将三路特征沿通道维度拼接后,经 $1 \times 1$ 点卷积压缩,再通过残差相加:

$F_7^{(h,w,c_2)} = F_6^{(h,w,c_2)} \oplus F_{\text{Input}}^{\prime(h,w,c_2)}$

② CGLU 前馈子块

  • 采用卷积门控线性单元(CGLU),将深度可分离卷积(DWConv)引入标准 GLU;
  • 替代传统 SE 模块的全局平均池化,实现精准的空间建模与精细特征提炼:

$F_{\text{Output}}^{(h,w,c_2)} = \text{CGLU}\left(\text{BN}\left(F_8^{(h,w,c_2)}\right)\right) \oplus F_8^{(h,w,c_2)}$

MSK-Net 的多尺度策略:浅层(Stage1~2)使用小核(3, 5)捕捉精细空间细节,深层(Stage3~4)使用大核(7)聚合更丰富的上下文信息。


六、实验结果

6.1 实验设置

  • 硬件:Ubuntu 22.04,Intel Xeon Gold 5318Y,NVIDIA RTXA6000(48GB)
  • 框架:PyTorch,CUDA 12.1,cuDNN 8.9
  • 训练配置:输入 640×640,batch size=16,训练 160 epochs,AdamW 优化器
  • 评估指标:COCO 标准 AP 体系(AP₅₀、AP₇₅、AP),并针对 IRShip 重新定义目标尺寸类别——微小目标 [0,40]、小目标 [0,80]、中等 [80,256]、大目标 [256,1e5](分别占总目标的 11.5%、34.1%、38%、16.4%),引入 AP_T 评估微小目标。

6.2 卷积模块对比

【此处配 Table III:DFine-n 模型搭载不同卷积模块在 ISDD、IRSDSS、Maritime-sirst 上的实验结果对比表】

作者在 DFine-n 基础上替换卷积模块,与 gConv、DSConv、PsConv、PConv、SCConv、DEConv、DRConv、WTConv2D、ShiftwiseConv 等共 9 种先进卷积进行对比:

  • 大多数卷积模块未能稳定提升性能,部分甚至低于标准卷积;
  • PsConv(风车形卷积)在 ISDD/IRSDSS 上略有提升,但在 Maritime-sirst 上 AP 和 AP₇₅ 分别下降 1.4% 和 2.7%;
  • CKConv(5) 在 ISDD 上 AP₅₀ 和 AP₇₅ 提升 2.2% 和 3.4%;
  • CKConv(3,5,7) 在 Maritime-sirst 上 AP₅₀、AP₇₅、AP 分别大幅提升 7.3%、13.1%、7.1%,表现最优。

6.3 消融实验

6.3.1 数据增强消融

【此处配 Table IV:数据增强策略消融实验结果表(CP、PB、Dense-O2O 的不同组合)】

关键发现:

  • 单独使用 CP 反而降低了检测精度(因目标被粘贴到不合理的复杂背景);
  • CP-PB 显著提升 AP、AP₅₀、AP₇₅ 超过 1.5%;
  • CP-PB + Dense-O2O 组合效果最优,AP₅₀ 和 AP₇₅ 提升超过 3.9%,小目标检测精度提升 6.2%
6.3.2 模块消融实验

【此处配 Table V:模块消融实验结果表(逐步加入 Dense-O2O、MSK-Block、CKConv、CGLU、Stem-ck)】

完整 MSCK-Net-N 相比 Baseline-N:AP₅₀ +6.3%,AP₇₅ +8.8%,AP +6.3%,AP_S +6.6%。

6.3.3 特征层融合消融

【此处配 Table VI:不同特征层融合方案的消融实验结果表(N/S/M 三种规模及其基线对比)】

MSCK-Net-N 仅使用 P3+P4 融合,却能超越使用 P2+P3+P4 融合的 Baseline-S,同时仅需其 37.3% 的参数量48% 的计算量,并实现 34.5% 的 FPS 提升——这有力证明了 CKConv 在低层特征保留上的优越性。

6.4 与通用目标检测算法对比

【此处配 Table VII:20 种通用目标检测算法在 IRShip 上的定量对比表(一阶段、两阶段、端到端三大类)】

【此处配 Fig. 10:多种模型在 IRShip 数据集上的可视化检测结果对比图(近岸和离岸场景)】

与 YOLO 系列、Faster R-CNN、RT-DETR、DEIM 等 20 种检测器对比:

  • MSCK-Net-M:AP₅₀=82.5%,AP₇₅=53.1%,AP=50.9%,综合性能最优;
  • MSCK-Net-S:AP₅₀=81.1%,AP=49.3%,在同等规模模型中参数最少、算力最低;
  • vs. YOLOv8s:MSCK-Net-N 仅用 34.14% 的参数和 41.9% 的 GFLOPs,AP₅₀ 提升 13.6%,FPS 提升 40.2%
  • vs. 次优的 DEIM-S:MSCK-Net-N 用 37.33% 的参数和 48.03% 的 GFLOPs,AP₅₀ 提升 2.5%,FPS 提升 69.6%

6.5 与红外目标检测算法对比

【此处配 Table VIII:6 种红外目标检测算法(ACM、RISTD、AGPCNet、DNANet、EFLNet、IR-DETR)在 IRShip 上的对比表】

与 ACM、RISTD、AGPCNet、DNANet、EFLNet、IR-DETR 共 6 种红外目标检测算法对比,MSCK-Net-M 以最少的参数量和计算量取得最优性能

  • vs. 次优 EFLNet:参数减少 66.88%,GFLOPs 减少 44.25%
  • AP₅₀ +6%,AP₇₅ +13.5%,AP +9.7%;
  • AP_T +10.5%,AP_S +13.6%,AP_M +9.7%(小目标和微小目标检测优势尤为突出)。

七、泛化性能分析

7.1 跨数据集泛化

【此处配 Fig. 11:MSCK-Net-N 与 Baseline-N 在 5 个数据集上的泛化性能折线对比图】

在 NUDT-SIRST-Sea、ISDD、IRSDSS、Maritime-sirst、IRShip 上全面评估,MSCK-Net-N 均优于 Baseline-N:

  • NUDT-SIRST-Sea:AP₅₀ +9.4%,AP₇₅ +7.8%,AP +6.7%;
  • Maritime-SIRST:AP₅₀ +6.2%,AP₇₅ +12.2%,AP +6.5%;

这充分验证了大规模数据集训练对模型泛化能力的显著增益。

7.2 零样本跨数据集迁移

【此处配 Fig. 12:(a) MSCK-Net-N 与 Baseline-N 在 IRShip 训练后的跨数据集泛化雷达图;(b) 独立训练 vs IRShip 训练的泛化对比雷达图】

在 IRShip 上训练后进行零样本迁移测试,与在各子数据集上独立训练相比:

  • NUDT-SIRST-Sea:AP₅₀ 提升 15%
  • Maritime-SIRST:AP₅₀ 提升 10.4%

这有力证明了 IRShip 数据集整合策略的有效性,以及大规模多样化数据对于训练泛化模型的不可替代价值。


八、特征可视化分析

【此处配 Fig. 13:MSCK-Net-S 在 IRShip 数据集不同场景下的 Eigen-CAM 特征可视化图(内河、近岸、离岸三类场景)】

通过 Eigen-CAM 可视化分析,MSCK-Net 展现出以下特性:

  • 内河场景:精准高亮河岸和舰船主体,清晰区分水域与陆地边界;
  • 近岸场景:在多尺度混合环境中有效抑制复杂港口背景,专注于舰船目标,对 DSIRSTs 保持高定位精度;
  • 离岸场景:背景干扰少时,成功识别密集和孤立 DSIRSTs 的关键区域,提升检测与定位效果;
  • ROI 热图紧凑、集中,与真实目标轮廓高度吻合,证明了网络深层特征提取与融合能力的有效性。

九、总结与展望

本文提出的 MSCK-Net 在红外舰船检测领域实现了数据与模型的双重突破:

主要贡献回顾

贡献 内容 效果
IRShip 数据集 整合4个公开数据集,27,138张图像,36,341个目标 大幅提升数据多样性与泛化基础
CP-PB 增强 泊松混合替代直接粘贴,区域智能筛选 AP₅₀ +1.5%,小目标 +6.2%(与 Dense-O2O 联用)
Dense-O2O 4阶段在线增强,缓解 DETR 正样本不足 加速收敛,提升检测稳定性
CKConv 水平+垂直+方形的中国结式交织结构 低层特征提取能力显著提升
MSK-Block + Stem-ck 多尺度 CKConv 嵌入骨干浅层与深层 AP₅₀ +6.3%,AP₇₅ +8.8%(vs 基线)
MSCK-Net 端到端轻量检测框架 超越 26 种 SOTA 方法,综合精度最优

局限与未来方向:目前框架在训练阶段仍需较大内存与计算资源,限制了在资源受限边缘设备(如无人机、嵌入式平台)上的部署。未来将着重优化训练效率,探索面向边缘计算的轻量化与加速方案。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐