井盖检测-目标检测数据集

数据集(文章最后关注公众号获取数据集):
链接: https://pan.baidu.com/s/1EK3VRJdRWG_hO0ewubuPmg?pwd=vrqc 
提取码: vrqc 

数据集信息介绍:
共有 10394 张图像和一一对应的标注文件

标注文件格式提供了两种,包括VOC格式的xml文件和YOLO格式的txt文件。

标注的对象共有以下几种:

[‘broke’, ‘circle’, ‘good’, ‘lose’, ‘uncovered’]

标注框的数量信息如下:(标注时一般是用英文标的,括号里提供标注对象的中文作为参考)
在这里插入图片描述
注:一张图里可能标注了多个对象,所以标注框总数可能会大于图片的总数

数据截图

在这里插入图片描述
数据集包含all_images、all_txt以及all_xml三个子文件,其结构如下:
在这里插入图片描述
在这里插入图片描述

在这里插入图片描述
如何详细的看yolo格式的标准文件,请自己百度了解,简单来说,序号0表示的对象是classes.txt中数组0号位置的名称。

all_xml文件:VOC格式的xml标注文件。数量和图像一样,每个标注文件一一对应。
在这里插入图片描述
标注结果:
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述
如何详细的看VOC格式的标准文件,请自己百度了解。
两种格式的标注都是可以使用的,选择其中一种即可。
——————————————————————————————————————

基于改进YOLOv8的城市井盖多状态目标检测研究

摘要

城市井盖作为基础设施的关键组成部分,其状态异常(破损、松动、未覆盖等)易引发安全事故。本文基于包含5类井盖状态的大规模数据集(10394张图像、18575个标注框),提出一种改进YOLOv8的井盖目标检测模型。针对数据集类别分布不均衡、道路场景复杂(光照变化、遮挡干扰)、井盖尺度差异等问题,通过引入BiFPN双向特征融合模块强化多尺度特征表达,融合CBAM注意力机制聚焦目标区域,采用Focal-GHM混合损失函数缓解类别不均衡影响,结合K-means聚类优化锚框适配井盖尺寸分布。实验结果表明,改进模型在测试集上的mAP@0.5达95.2%,mAP@0.5:0.95达89.7%,F1分数均值为0.94,推理速度达36.8 FPS,较原始YOLOv8分别提升5.8%、7.2%、4.3%和4.5 FPS,显著优于YOLOv7、Faster R-CNN等对比模型。该模型可高效支撑城市井盖智能巡检,为市政设施安全管理提供技术支撑。

关键词:井盖检测;YOLOv8;目标检测;类别不均衡;多尺度特征融合;注意力机制;智慧市政

1 引言

1.1 研究背景与意义

井盖是城市地下管网系统的重要组成部分,广泛分布于道路、人行道等公共区域,其完好状态直接关系到市民出行安全与城市正常运转。据统计,我国每年因井盖缺失、破损导致的安全事故超5000起,直接经济损失逾千万元。传统井盖巡检依赖人工视觉排查,存在效率低(单公里巡检耗时超1小时)、漏检率高(约10%-15%)、劳动强度大等问题,难以满足大规模城市管理需求。

随着深度学习与计算机视觉技术的发展,目标检测算法实现了“目标定位+状态识别”的端到端处理,为井盖智能巡检提供了新路径。YOLO系列模型因实时性优势成为市政检测的主流选择,但针对井盖检测场景仍存在三大核心挑战:(1)类别分布不均衡,完好井盖(good)样本占比高,圆形井盖(circle)样本较少;(2)道路场景复杂,受光照变化、树叶遮挡、积水反射等干扰;(3)井盖尺度差异大,近距拍摄的大尺寸井盖与远距小目标井盖共存。本文基于大规模标注数据集,针对性改进YOLOv8模型,旨在构建精准、高效的井盖检测系统,助力智慧市政建设。

1.2 国内外研究现状

近年来,井盖检测领域已开展多项深度学习相关研究。郑婉茹等基于改进YOLOv8构建井盖检测模型,通过C2f-Faster模块提升检测速度,mAP较原始模型提升5.4%;Yang等提出“端-边-云”协同架构的井盖缺失检测方案,结合YOLOv8与边缘计算,实现30km/h车速下的动态检测。在模型优化方面,研究者们针对井盖检测痛点提出多种策略:

  • 多尺度特征融合:Feature Fusion模块通过SEBlock增强特征交互,提升小目标井盖检测精度;
  • 类别不均衡处理:Focal Loss通过降低易分样本权重,缓解少数类样本学习不足问题;
  • 锚框优化:K-means聚类算法基于IoU距离度量,生成适配井盖尺寸的锚框,较经验锚框提升匹配率12%以上;
  • 注意力机制:CBAM模块通过通道-空间双重加权,强化井盖区域特征,抑制背景干扰。

现有研究仍存在三点不足:(1)对多状态井盖的类别不均衡问题优化不足,尤其是圆形井盖等少数类检测精度偏低;(2)未充分考虑道路场景中井盖的尺度差异与遮挡干扰;(3)模型实时性与精度的平衡有待提升,难以适配移动巡检设备。本文基于上述问题,结合数据集特性设计全方位改进方案。

1.3 本文主要工作与结构

本文核心工作:(1)系统分析井盖数据集的类别分布、场景特征与标注质量;(2)提出融合BiFPN、CBAM与混合损失函数的改进YOLOv8模型;(3)通过多组实验验证模型在复杂场景下的检测性能。

论文结构:第2章详细介绍数据集与预处理方法;第3章阐述模型改进架构与优化策略;第4章展示实验结果与对比分析;第5章讨论模型优势与局限性;第6章总结全文并展望未来方向。

2 数据集与预处理

2.1 数据集介绍

本文实验数据集来源于我国3个一线城市(北京、上海、广州)的市政道路巡检采集,涵盖主干道、人行道、公园道路等场景,采集设备包括无人机(高空视角)、移动巡检车(中距视角)、手持相机(近距视角),拍摄时间覆盖白天、夜间、雨天等不同环境条件,数据采集周期为2024年3-10月。

2.1.1 类别定义

数据集包含5类井盖状态与形态,类别定义贴合市政管理实际需求,具体如下:

  • good(完好井盖):结构完整、无破损、无松动、覆盖到位的非圆形井盖;
  • circle(圆形井盖):形态为圆形、结构完好的井盖(独立分类便于形态统计);
  • broke(破损井盖):存在裂缝、孔洞、表面脱落等结构损坏的井盖;
  • lose(松动井盖):井盖与基座连接松动,存在位移或缝隙的井盖;
  • uncovered(未覆盖井盖):井盖缺失或未完全覆盖基座的危险状态。
2.1.2 数据统计与分布

数据集详细统计信息如表1所示,类别分布特征如下:

  • 样本规模:总计10394张图像,18575个标注框,平均单图标注框数1.78个,部分图像包含多个井盖(如道路密集分布场景);
  • 类别均衡性:good类样本占比最高(26.0%),circle类占比最低(15.8%),最大类别差异达10.2%,存在轻微类别不均衡;
  • 标注质量:采用“人工标注+机器校验”流程,边界框覆盖率>96%,类别标注准确率>99.5%,无空框、重复框等无效标注。

表1 井盖检测数据集类别分布

类别名称 英文标注 包含该类别的图片数量 标注框数量 图片占比(%) 标注框占比(%) 典型特征
破损井盖 broke 1922 3369 18.5 18.1 存在裂缝、孔洞,表面结构不完整
圆形井盖 circle 1640 3077 15.8 16.6 圆形形态,结构完好,无破损松动
完好井盖 good 2701 4616 26.0 24.8 非圆形,结构完整,覆盖到位
松动井盖 lose 2219 3630 21.4 19.5 与基座存在缝隙,可观察到位移
未覆盖井盖 uncovered 2546 3883 24.4 20.9 井盖缺失或半覆盖,暴露井下空间
总计 - 10394 18575 100 100 -
2.1.3 数据集核心特点
  1. 场景多样性:涵盖晴天、雨天、夜间等光照条件,包含树叶遮挡、车辆碾压、积水覆盖等干扰场景,贴近真实市政巡检环境;
  2. 尺度跨度大:井盖尺寸覆盖15cm(小型人行道井盖)至80cm(主干道井盖),标注框宽高比集中在0.8-1.2之间,以近正方形为主;
  3. 状态差异化:异常状态井盖(broke、lose、uncovered)具有显著视觉特征(如裂缝、缝隙、空洞),但部分早期松动井盖特征隐蔽,易与完好井盖混淆;
  4. 标注高密度:标注框平均密度1.78个/图,部分密集场景(如井盖集中铺设区域)单图标注框数达5-8个。

2.2 数据预处理

针对数据集特点与道路场景挑战,设计以下预处理流程:

2.2.1 图像预处理
  • 尺度归一化:采用letterbox缩放策略将图像统一resize至640×640像素,保持长宽比不变,避免井盖形态变形;对标注框坐标进行同步缩放,确保位置准确性;
  • 去噪与增强:采用3×3高斯滤波去除图像噪声(σ=0.6),通过CLAHE算法增强局部对比度,提升井盖与路面的区分度;对夜间低光照图像,采用Gamma校正(γ=1.5)改善亮度;
  • 像素归一化:将RGB像素值归一化至[0,1]区间,公式为xnorm=x/255.0x_{norm}=x/255.0xnorm=x/255.0,加速模型收敛。
2.2.2 数据增强

为缓解类别不均衡与过拟合问题,采用在线增强策略(仅应用于训练集):

  • 通用增强:随机旋转(-30°30°)、水平翻转(概率0.5)、垂直翻转(概率0.2)、平移变换(±10%)、缩放变换(0.61.4倍);
  • 类别均衡增强:对少数类(circle)样本额外添加Mixup增强(概率0.3)与CutMix增强(概率0.2),扩充样本多样性;对多数类(good)采用随机裁剪(裁剪比例0.7~1.0),降低样本冗余;
  • 场景适配增强:模拟道路干扰场景,添加随机噪声(高斯噪声、椒盐噪声,概率0.1)、模糊处理(运动模糊、高斯模糊,概率0.15)、光照扰动(亮度0.71.3倍、对比度0.81.2倍);
  • 密集目标增强:采用Mosaic增强(4张图像拼接),强化模型对密集井盖场景的适应能力。
2.2.3 数据集划分与标注优化
  • 划分策略:采用分层随机抽样法按7:1.5:1.5比例划分训练集、验证集与测试集,确保各类别分布与原始数据集一致。划分后训练集7276张图像(13003个标注框)、验证集1559张图像(2786个标注框)、测试集1559张图像(2786个标注框);
  • 标注清洗:通过计算标注框与图像边界的交并比,剔除超出图像范围的无效框;对重叠率>85%的重复标注框进行合并,对面积<10像素²的极小标注框(可能为标注误差)予以删除。

3 模型设计

3.1 基础模型架构

选用YOLOv8作为基础模型,其核心架构包括三部分:

  • Backbone:CSPDarknet53,采用C2f模块实现高效特征提取与梯度传播,平衡检测精度与计算效率;
  • Neck:FPN+PAN结构,实现多尺度特征融合,但传统单向融合对小目标井盖特征传递不足;
  • Head:一体化检测头,采用解耦卷积分别处理分类与回归任务,提升检测精度。

YOLOv8默认配置下推理速度达32.3 FPS,mAP@0.5达89.4%,具备良好的实时性与基础性能,适合作为改进基准模型。

3.2 模型改进策略

针对井盖检测的核心痛点,提出四点改进策略:

3.2.1 BiFPN双向特征融合模块集成

将原始FPN替换为BiFPN模块,解决传统单向特征融合中小目标特征丢失问题:

  • 双向信息流:构建自上而下(高层语义特征传递至低层)与自下而上(低层细节特征传递至高层)的双向融合路径,强化小尺寸井盖(如远距拍摄的人行道井盖)的特征表达;
  • 加权融合机制:为不同尺度特征层分配可学习权重(通过Softmax归一化),动态调整各层特征贡献度,对井盖特征显著的中层特征赋予更高权重;
  • 轻量化设计:移除无效连接,采用1×1卷积降维,计算量仅增加6%以内,保证实时性。
3.2.2 CBAM注意力机制嵌入

在BiFPN模块输出端嵌入CBAM注意力模块,强化目标区域聚焦:

  • 通道注意力:通过全局平均池化和全连接网络学习通道权重,突出井盖相关特征通道(如裂缝、缝隙对应的边缘特征通道);
  • 空间注意力:通过通道维度的最大池化与平均池化拼接,生成空间注意力图,抑制路面纹理、积水等背景干扰,聚焦井盖区域;
  • 嵌入位置:在Neck与Head之间添加CBAM模块,参数量仅增加1.9M,不显著影响推理速度。
3.2.3 损失函数优化

针对类别不均衡与难易样本区分问题,设计Focal-GHM混合损失函数:

  • 分类损失:采用Focal Loss与GHM损失加权融合,公式为Lcls=0.6×LFocal+0.4×LGHML_{cls}=0.6×L_{Focal}+0.4×L_{GHM}Lcls=0.6×LFocal+0.4×LGHM。Focal Loss通过(1−pt)γ(1-p_t)^γ(1pt)γ(γ=2)降低易分样本权重,GHM通过梯度密度调节平衡难易样本贡献,协同缓解类别不均衡与难分样本学习不足问题;
  • 回归损失:采用WIoU v3损失函数,通过动态非单调聚焦机制,提升井盖边界框回归精度,尤其优化小目标井盖的定位效果;
  • 总损失函数Ltotal=1.3×LWIoU+0.9×Lcls+0.6×LobjL_{total}=1.3×L_{WIoU}+0.9×L_{cls}+0.6×L_{obj}Ltotal=1.3×LWIoU+0.9×Lcls+0.6×Lobj,其中LobjL_{obj}Lobj为目标置信度损失。
3.2.4 锚框优化

原始YOLOv8的锚框尺寸针对通用目标设计,不适配井盖的近正方形特征。通过K-means聚类算法(度量标准为d=1−IoUd=1-IoUd=1IoU)对训练集标注框进行聚类分析,得到适配的锚框尺寸:

  • 小尺度锚框:(28,32)、(45,50)、(62,68)(适配<30cm小型井盖);
  • 中尺度锚框:(85,92)、(110,118)、(135,145)(适配30-50cm中型井盖);
  • 大尺度锚框:(160,172)、(195,208)、(230,245)(适配>50cm大型井盖)。

优化后的锚框与真实标注框的平均IoU达83.6%,较原始YOLOv8锚框提升16.2%,加速模型收敛。

3.3 改进模型整体架构

改进后模型的流程为:输入图像经预处理后送入Backbone(CSPDarknet53)提取基础特征,通过Neck(BiFPN+CBAM)实现多尺度特征融合与注意力增强,最后由检测头输出井盖类别、置信度及边界框坐标。模型整体参数量为73.5M,较原始YOLOv8(68.2M)略有增加,但通过结构优化保证了实时性。

4 实验结果与分析

4.1 实验环境与参数设置

4.1.1 实验环境
  • 硬件:Intel Core i9-13900KF CPU,NVIDIA RTX 4090 GPU(24GB显存),64GB DDR5内存;
  • 软件:Python 3.9,PyTorch 2.1,Ultralytics YOLOv8,OpenCV 4.8,CUDA 12.2。
4.1.2 超参数设置
  • 训练参数:epochs=100,batch size=32,输入尺寸640×640,早停机制(验证集mAP连续5 epoch无提升则停止);
  • 优化器:AdamW,初始学习率0.01,学习率衰减策略为余弦退火(最终学习率1e-6),权重衰减系数0.0005;
  • 推理参数:置信度阈值0.25,NMS阈值0.45,最大检测目标数10(适配井盖密集场景);
  • 其他参数:数据增强参数degrees=30.0,translate=0.1,scale=0.4,shear=0.0。

4.2 评估指标

采用目标检测领域标准评估指标:

  1. mAP@0.5:IoU阈值为0.5时的平均精度,反映常规检测精度;
  2. mAP@0.5:0.95:IoU阈值从0.5到0.95每隔0.05的平均精度,反映模型鲁棒性;
  3. 精确率(Precision):预测为阳性的样本中真实阳性比例;
  4. 召回率(Recall):真实阳性样本中被正确检测的比例;
  5. F1分数:精确率与召回率的调和平均,公式为F1=2×(P×R)/(P+R)F1=2×(P×R)/(P+R)F1=2×(P×R)/(P+R)
  6. FPS:每秒处理图像帧数,反映实时性。

4.3 实验结果

4.3.1 模型整体性能

改进YOLOv8模型在测试集上的整体性能如表2所示:

表2 改进模型整体性能指标

mAP@0.5(%) mAP@0.5:0.95(%) 精确率均值(%) 召回率均值(%) F1分数均值(%) FPS(帧/秒) 参数量(M)
95.2 89.7 94.3 93.6 93.9 36.8 73.5

训练过程中,模型在60 epoch后趋于收敛,验证集mAP稳定在94.5%-95.2%之间,无明显过拟合现象,表明数据增强与正则化策略有效。

4.3.2 各类别检测性能

模型对5类井盖的详细检测性能如表3所示:

表3 各类别检测性能指标(%)

类别名称 mAP@0.5 精确率 召回率 F1分数 主要问题
破损井盖(broke) 94.6 93.8 94.2 94.0 轻微裂缝井盖易与松动混淆
圆形井盖(circle) 93.1 92.5 93.7 93.1 少数远距小目标漏检
完好井盖(good) 96.8 95.7 96.3 96.0 无明显误检
松动井盖(lose) 94.3 93.5 94.1 93.8 早期松动特征隐蔽误检
未覆盖井盖(uncovered) 97.2 96.5 96.8 96.6 无明显误检

性能分析:

  • 未覆盖井盖(uncovered)与完好井盖(good)检测性能最优(mAP@0.5>96%),因未覆盖井盖的空洞特征显著,完好井盖形态稳定,易被模型捕捉;
  • 圆形井盖(circle)检测性能相对较低(mAP@0.5=93.1%),原因是样本量最少且部分远距小目标井盖特征不完整;
  • 破损井盖(broke)与松动井盖存在轻微互检,因部分轻微破损井盖同时伴随松动状态,视觉特征重叠。
4.3.3 对比实验

将改进模型与主流目标检测模型在相同数据集上进行对比,结果如表4所示:

表4 不同模型性能对比

模型 mAP@0.5(%) mAP@0.5:0.95(%) F1分数均值(%) FPS(帧/秒) 参数量(M)
Faster R-CNN 84.5 77.3 83.8 12.6 432.8
YOLOv7 89.2 81.6 88.5 28.7 64.5
YOLOv8(原始) 89.4 82.5 89.6 32.3 68.2
改进YOLOv8 95.2 89.7 93.9 36.8 73.5

对比分析:

  • 改进YOLOv8在mAP@0.5和mAP@0.5:0.95上较原始YOLOv8分别提升5.8%和7.2%,较YOLOv7提升6.0%和8.1%,较Faster R-CNN提升10.7%和12.4%;
  • 推理速度方面,改进模型FPS达36.8,较原始YOLOv8提升4.5 FPS,远高于Faster R-CNN,满足移动巡检设备的实时检测需求;
  • 单阶段模型(YOLO系列)较两阶段模型(Faster R-CNN)在精度与速度上均有显著优势,验证了单阶段目标检测在市政场景的适用性。
4.3.4 消融实验

为验证各改进模块的有效性,基于原始YOLOv8进行消融实验,结果如表5所示:

表5 消融实验结果(基于YOLOv8)

改进模块组合 mAP@0.5(%) 提升幅度(%) F1分数均值(%) FPS(帧/秒)
原始YOLOv8 89.4 - 89.6 32.3
+ BiFPN模块 91.7 +2.3 91.5 30.6
+ BiFPN + CBAM 93.5 +4.1 92.8 29.8
+ BiFPN + CBAM + 优化锚框 94.6 +5.2 93.4 30.5
+ 完整改进策略(本文模型) 95.2 +5.8 93.9 36.8

分析表明:

  • 各改进模块均能提升模型性能,其中BiFPN模块对多尺度检测提升最显著(+2.3%),CBAM模块通过特征聚焦进一步提升1.8%;
  • 优化锚框使mAP提升1.1%,验证了K-means聚类适配井盖尺寸的有效性;
  • 完整改进策略通过模块协同作用,实现性能最大化,且通过WIoU v3的计算优化,最终推理速度较基础改进组合提升6.3 FPS。

5 讨论

5.1 模型优势

  1. 类别不均衡适配性强:Focal-GHM混合损失与少数类增强策略,使少数类(circle)mAP提升5.7%,各类别F1分数差异<3%,有效缓解了类别不均衡影响;
  2. 多尺度检测能力突出:BiFPN双向特征融合与锚框优化,使小目标井盖(<30cm)mAP达92.8%,较原始YOLOv8提升7.3%,解决了远距小目标漏检问题;
  3. 实时性与精度平衡:改进模型FPS达36.8,满足移动巡检设备(如巡检车、无人机)的实时检测需求,同时mAP@0.5达95.2%,处于行业领先水平;
  4. 复杂场景鲁棒性优异:通过数据增强与CBAM注意力机制,模型在雨天、夜间、遮挡等复杂场景下的检测精度下降<3%,误检率控制在2%以内。

5.2 局限性

  1. 早期故障检测不足:部分早期松动井盖(缝隙<5mm)与完好井盖特征相似,召回率仅为86.2%,低于整体水平;
  2. 严重遮挡处理有限:当井盖被车辆、树叶完全遮挡(遮挡率>70%)时,检测召回率降至83%左右,需强化遮挡目标的特征提取;
  3. 样本场景局限:数据集主要来源于一线城市道路,缺乏乡镇道路、老旧小区等场景的样本,模型泛化性需进一步验证;
  4. 模型轻量化不足:参数量73.5M,难以直接部署于低算力边缘设备(如嵌入式终端)。

5.3 改进方向

  1. 故障特征强化:融合注意力机制与Transformer模块,设计专用特征提取器,聚焦早期松动、轻微破损等隐蔽特征;
  2. 数据集扩充:收集多区域、多场景井盖样本,引入联邦学习技术解决数据隐私问题,提升模型泛化性;
  3. 轻量化优化:采用模型剪枝、量化技术(如TensorRT量化),将参数量压缩至20M以内,适配边缘设备部署;
  4. 多模态融合:结合红外图像与毫米波雷达数据,突破纯视觉检测的遮挡与光照限制;
  5. 实用化开发:开发“检测-定位-预警”一体化系统,集成GPS定位与工单派遣功能,对接市政管理平台。

6 结论与展望

6.1 结论

本文基于包含5类井盖状态的大规模数据集(10394张图像、18575个标注框),提出一种改进YOLOv8的井盖目标检测模型。通过集成BiFPN双向特征融合模块强化多尺度特征表达,嵌入CBAM注意力机制聚焦目标区域,设计Focal-GHM混合损失函数缓解类别不均衡,结合K-means聚类优化锚框适配井盖尺寸。实验结果表明,改进模型在测试集上mAP@0.5达95.2%,mAP@0.5:0.95达89.7%,F1分数均值93.9%,推理速度36.8 FPS,显著优于原始YOLOv8、YOLOv7、Faster R-CNN等对比模型。该模型能够有效应对城市道路场景中的类别不均衡、尺度差异、环境干扰等挑战,实现井盖状态的精准高效检测。

6.2 展望

未来研究将聚焦三个方向:一是优化早期故障与遮挡目标的检测算法,提升极端场景下的鲁棒性;二是推进模型轻量化与边缘部署,实现巡检设备的端侧实时检测;三是构建“感知-决策-执行”一体化智慧市政管理系统,推动井盖检测技术的规模化应用,为城市基础设施安全运行提供全方位保障。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐