摘要

        行人检测仍然是计算机视觉、监视和自动驾驶等各个领域的关键问题。特别是,在低光照条件和能见度降低的情况下,对行人进行准确、即时的检测,对于自动驾驶汽车预防事故和挽救生命至关重要。本文旨在全面调查专门针对弱光条件的各种行人检测方法、基线和数据集。该调查讨论了夜间行人检测所面临的挑战,并探讨了近年来为解决这一问题而提出的最先进的方法。这些方法涵盖了各种各样的方法,包括基于深度学习的、基于特征的和混合的方法,这些方法在增强具有挑战性的照明条件下的行人检测性能方面显示出了有希望的结果。此外,该论文强调了该领域当前的研究方向,并确定了值得研究人员进一步研究的潜在解决方案。通过彻底研究弱光条件下的行人检测技术,本调查旨在促进更安全、更可靠的自动驾驶系统和其他与行人安全相关的应用的发展。因此,目前该领域的大多数方法都使用基于深度学习的图像融合方法(即早期、中途和后期融合)来进行准确可靠的行人检测。此外,该领域的大部分作品(约48%)已经在KAIST数据集上进行了评估,而作者记录的真实世界视频馈电在不到6%的作品中得到了使用。

1、基准数据集

1.1 俄亥俄州立大学(OSU)数据集:

        作为第一批行人数据集之一,该热数据库提供了一个总在校园和街道上拍摄的分辨率为360 × 240的1.9k热帧数。OSU由三种不同的对象组成,包括人、车和电线杆。在这个数据集中总共注释了984个人。https://vcipl-okstate.org/pbvs/bench/Data/01/download.html

1.2 labatoire d 'Interpr ' ation et de Traitement d 'Images et Vid ' eo (LITIV) :

        数据集有9个视频序列,每个序列包含室内大厅中的人,具有不同的缩放设置。这些视频序列的主要挑战是物体的强烈遮挡和杂乱的背景。https://www.polymtl.ca/litiv/en/codes-and-datasets

1.3 CVC-09数据集:

CVC-09是另一个众所周知的数据集,它是在白天和晚上采集的,帧数为11k。该数据集包含训练集和测试集,其中白天和黑夜序列分别包含5,990帧和5,081帧。

http://adas.cvc.uab.es/elektra/enigma-portfolio/item-1/

1.4 远红外系统智能实验室(LSI-FIR)数据集:

该数据集由分类和检测部分组成,包含在不同温度和不同照明下收集的灰度图像。分类部分有16,152个阳性样本(即行人)和65,440个阴性样本(即背景),而检测部分包括15,224个图像,分为6,159个训练和9,065个测试实例。

1.5 热红外视频(TIV)、韩国科学技术院(KAIST)、夜间行人数据集(NTPD)、CVC-14数据集、启明大学(KMU)数据集、UTokyo、CAMEL、nighttowlsb、华南理工大学(SCUT)数据集、YU FIR、前视红外(FLIR)数据集、ZUT数据集、微光可见图像人(LLVIP)数据集和C3I热汽车数据集。

2、存在的问题

        在低光照条件和能见度降低的情况下,对行人进行准确、即时的检测,对于自动驾驶汽车预防事故和挽救生命至关重要。

        不同的照明条件、不同的行人外观和姿势、遮挡、伪装和杂乱的背景都可能给行人检测系统带来问题。关于所介绍的挑战,低照度是主要问题与其他问题相比,因为它有自然或环境相关的原因,无法预防或自然处理。

        尽管一些方法使用了光探测和测距(LiDAR)传感器,这是一种精确的遥感技术,利用激光进行距离测量和避障,但这种传感器并不能提供来自周围环境的丰富信息。

        最近很少有作品专注于夜间和低能见度条件下的行人检测。在低照度场景下,仅配备视觉传感器的自动驾驶汽车要检测道路上的移动物体并防止事故发生,难度要大得多。

        RQ1哪些数据集和基线主要用于弱光行人检测任务? 
        RQ2当前基于深度学习的算法在低照度行人检测中有哪些发展趋势? 
        RQ3关于最先进的解决方案,在实际的大规模应用(如全自动驾驶汽车)中,目前存在的和未解决的挑战是什么?

3、最先进的技术

        对夜间行人检测领域一百多篇论文的调查;对用于此目的的知名基线和数据集进行回顾和分类;根据其建筑变化对夜间行人检测的最先进方法进行分类;识别该领域的当前趋势和未来方法。

        在考虑夜间和低照度条件下的行人检测方法时,设计此类框架时想到的主要架构之一是包含一个离线训练过程,该过程利用专用的行人图像数据集来训练分类模型。在这方面,该模型学习了黑暗环境中行人特有的隐藏模式和特征,使其能够将其与其他物体或背景元素区分开来。

图4显示了夜间行人检测的这些典型阶段,以及它们是如何相互连接的。我们可以看到构成基础并起到关键作用的典型阶段无论采用何种具体方法,识别行人的组成部分。无论框架是采用手工特征、机器学习模型还是两者的混合,它通常都包含标准阶段,包括感兴趣区域(ROI)选择(即识别图像中潜在的行人区域)、视觉特征提取(即从所选的ROI中捕获相关信息)、行人分类(即使用特征将检测到的区域分类为行人或非行人),以及位置计算(即确定检测到的行人的精确位置)。

3.1 手工制作的功能方法

        手工特征包含手工设计和从输入图像/帧中选择特定的视觉特征。使用这样的特征提取信息具有简单、透明、可解释性的优点,并且能够在类似的场景中提供一致的结果。它们通常需要更低的计算成本,并且在无法访问带注释的数据时仍然可以很好地工作。手工特征包含手工设计和从输入图像/帧中选择特定的视觉特征。使用这样的特征提取信息具有简单、透明、可解释性的优点,并且能够在类似的场景中提供一致的结果。它们通常需要更低的计算成本,并且在无法访问带注释的数据时仍然可以很好地工作。

        关于手工特征的内在特征,这一类中的大多数方法都需要使用热数据。作为该类别的首批作品之一,Davis等人[31]使用了由轮廓显著性图(CSM)衍生的广义人物模板和背景减法相结合的方法来识别行人在热框架中的位置。Nowosielski等人([42])提出了一种基于HAAR和adaboost的夜视框架来识别热图像中的人。一种名为热红外辐射累积通道特征(TIR-ACF)的方法采用热归一化方法来考虑行人检测的最高人体温度。Jeong等人[33]提出了一种基于级联随机森林(CaRF)分类器、低维haar样特征和定向中心对称局部二值模式(ocs - lbp)的方法,用于检测热图像中的突然行人过街。Kim等人设计了一种行人检测器,采用多级级联学习算法和定向梯度直方图(HOG)特征。此外,通过逆透视变换方法[44]将2D热图像映射到3D空间中,以估计从相机检测到的行人的距离。

        红外图像是夜间行人检测任务的另一个有价值的信息来源。Zhou等人[45]设计了一种针对红外图像的行人提取算法。作为另一种方法,Khalifa等人引入了一种前景检测框架,该框架通过对ROI应用块匹配算法来补偿相机运动,从而对连续帧之间的背景全局运动进行建模。Shahzad等人提出了一种新的程序,分别使用模板匹配、卡尔曼滤波器和HAAR级联分类器在IR系统中进行行人检测、跟踪和头部检测。Shahzad等人提出了一种新的程序,分别使用模板匹配、卡尔曼滤波器和HAAR级联分类器在IR系统中进行行人检测、跟踪和头部检测。

        综上所述,具有手工特征的方法在许多情况下可以提供可接受的结果。然而,由于它们的低判别性,它们通常无法处理复杂的场景,并且在适应新场景时似乎不太灵活。

3.2 深度学习的方法

        基于深度学习的解决方案利用神经网络的潜力,自动从原始图像数据中学习和提取特征。在这方面,适应性、多功能性、泛化(w.r.t.多样化的场景)和高性能的结果是采用深度神经网络(dnn)的预期结果。它们还具有自动学习特征的能力,减少了对手动特征工程的需求,同时集成了特征提取和检测步骤,以实现端到端的学习过程。然而,由于其计算密集型的性质,这一类的方法通常需要大量的标记数据进行训练和强大的硬件。此外,它们缺乏直接的可解释性,导致对其决策过程的解释具有挑战性,因此需要进行微调以提高其性能。

        最近的许多低光行人检测工作都将dnn作为其算法的不可避免的一部分。这些方法在本调查中根据其用例分为以下几类:

3.2.1 图像融合方法

        图像融合是指提取和融合多个传感器捕获的原始图像中最显著的特征,以生成具有互补信息的单幅图像,引人注目的场景描述等[49]。考虑到融合阶段,CNN融合架构可分为三种主要策略:即早期融合、中途融合和后期融合。

        早期基于融合的方法:在夜间行人检测的背景下,它表示在CNN的第一个卷积层之后整合视觉和热特征图。然而,在输入网络之前,融合IR和RGB图像以生成四通道输入是另一种可以在早期阶段执行低级特征融合的方法。作为[50]中最近介绍的一项工作,介绍了一种基于YOLO v3的[51]多光谱行人检测器,该检测器可以使用RGB,热成像和多光谱图像。

        基于中途融合的方法:作为近年来被广泛探索的一种融合策略,输入模态的融合操作发生在网络的中间阶段,即第四卷积层之后。Yang等人[53]设计了级联信息增强模块 (cascading Information Enhancement Module, CIEM) 和跨模态注意特征融合模块(Cross-modal Attention Feature fusion Module, CAFFM)作为中间融合工作之一,丰富行人信息,抑制背景噪声对颜色模态和热模态的干扰。将 Channel-wise Attention Module (CAM) 和Spatial-wise Attention Module (SAM)集成到多层融合CNN中,分别在channel-dimension和pixel-level对交叉光谱特征进行重加权。Zhang等人[27]提出了一种新的中途融合策略,该策略采用循环融合和细化操作,通过控制环路的数量来实现多光谱特征的一致性和互补平衡。在[55]中介绍了一种基于YOLO v5检测器的多光谱行人检测跨模框架。另一种方法是基于YOLO v5轻量级网络,Fu等人提出了一种自适应空间和像素级特征融合模块,称为ASPFF网络,用于获取两个特征图中空间位置和像素维度的融合权值。提出了一种基于Faster R-CNN的多层融合网络(MLF-FRCNN),该网络采用特征金字塔网络(FPN)和区域建议网络(RPN)作为两个并行特征提取器来处理不同尺度的行人样本。

        在基于半融合空间注意力的机制中,计算特征图中每个位置的重要性,突出显示有价值信息的区域。因此,Cao等人[59]在轻量级融合模块中使用了信道交换和空间注意(CSSA),在确保低计算成本的同时有效融合多模态输入。中引入了一种名为BAANet的双向融合策略,用于集成多光谱行人检测器的rgb -热特征。在另一项类似的工作中,Zhang等人[61]引入了一种名为引导注意特征融合(Guided attention Feature Fusion, GAFF)的两流CNN,在模态内和模态间注意机制的指导下,动态地重新权衡和整合多光谱行人特征。Qingyun等人[62]提出了一个跨模态融合变压器(cross -modal Fusion Transformer, CFT)模块,并将其嵌入到YOLO v5框架中。

        一些作品讨论了cnn中最常见的特征融合策略:Concatenation(即在精确的空间位置堆叠两个特征图)、summation(即计算两个特征图在精确的空间位置的和)、maximum(即在精确的空间位置获得两个特征图的最大响应)和mean(即,计算两个特征图在精确空间位置的平均值)[63]。Pei等人[63]讨论了这些策略在各种CNN融合架构中的影响,包括基于RetinaNet检测器的合并视觉光学(VIS)和IR图像[64]。Ding等人[65]采用基于区域的全卷积网络(R-FCN)框架中的网络中网络(NIN)[66]来合并两个子网络的图像信息,以处理大规模和小规模的行人实例。Yun等[67]提出了加权间和加权内交叉融合网络(inf - net),该网络使用高频助手(High-Frequency Assistant, HFA)在特征级别上逐步整合颜色和热特征。Bao等[68]提出了一种基于YOLO v7[69]的双YOLO方法,用于IR和可见光图像的融合。

        最近提出了许多用于多光谱行人检测的无锚管道,这加快了模型检测的速度,同时避免了锚盒复杂的超参数设置。基于[71]提出的双分支CenterNet[70]无锚检测器的两种特征融合方案,用于多光谱和多尺度行人检测。Cao等人[72]试图通过盒级分割监督学习框架训练一个没有锚盒的多光谱行人检测器,并计算热图。

        在一种创新的方法中,Tang等人[73]将光照考虑在内,设计了一种称为PIAFusion的渐进式图像融合网络,该网络可以自适应地保持显著目标的强度分布,并保留背景中的纹理信息。同样,Roszyk等人[74]将YOLO v4框架应用于自动驾驶中快速、低延迟的多光谱行人检测。同样,Roszyk等人[74]将YOLO v4框架应用于自动驾驶中快速、低延迟的多光谱行人检测。Peng等人[75]引入了嵌入分层内容相关注意融合(HCAF)模块和多模态特征对齐(MFA)块的分层注意融合网络(HAFNet),以克服背景噪声和模态不对齐问题。Yadav等人[76]使用Faster Region-based CNN (Faster R-CNN)分别为颜色和热构建了两个单模态编解码器特征网络[77]。Zhang等人[78]提出了一种跨模态交互注意网络(CIAN),对两种颜色和热光谱之间的相关性进行编码,并在上下文增强的特征层次上预测行人的位置和大小。Hu等人[79]提出了一种双模态多尺度特征融合网络(DMFFNet)。Cao等[81]基于YOLO v4模型建立了多光谱信道特征融合(Multi-spectral Channel Feature Fusion, MCFF)模块,
        根据不同光照条件融合多光谱特征。门控融合单元(Gated Fusion Units, GFU)[82]通过门控加权机制调整每种模态生成的特征图的贡献。门控融合单元(Gated Fusion Units, GFU)[82]通过门控加权机制调整每种模态生成的特征图的贡献。门控融合双SSD(GFD-SSD)[83]不是从每个通道中选择特征叠加并调整其权重,而是在[82]的激励下开发了两种GFU变体(即:门控融合(gated fusion)和混合融合(mixed fusion),融合两个Single Shot MultiBox Detector (SSD)[84]中间层生成的特征图,用于多光谱行人检测。

        基于后期融合的方法:也称为决策级融合,是一种高级融合技术,在最后一个卷积层之后和完全连接层之前进行拼接,或者合并两个子网络的输出,如位置和类别预测。Khalid等人[87]提出了两种融合检测人的方法:第一种方法采用编码器-解码器架构进行图像级融合,分别对可见帧和热帧进行独立编码,并将合并后的帧输入残差网络152 (Residual Network-152, ResNet-152)架构,将其输入到解码器中,生成单幅融合图像。第二种方法采用ResNet-152进行特征级融合,分别提取可见光图像和热图像的特征,并将其拼接成单个特征向量作为密集层的输入。Montenegro等人[88]定制了用于弱光行人检测的YOLO v5架构。Song等[89]设计了一种多光谱特征融合网络(MultiSpectral Feature Fusion Network, MSFFN),利用提取的可见通道和红外通道特征获得综合特征。选择性核网络(SKNet)[90]提出了一种动态选择方案,使用不同核大小的选择性核单元自适应调整接受场大小。

3.2.2 基于知识转移的方法:

        它包含具有不同方法的各种类别,包括迁移学习,有监督和无监督领域适应,知识蒸馏和记忆网络方法。

        迁移学习方法:迁移学习是将从预训练模型中获得的知识用于不同但相关的任务。在夜间行人检测的背景下,为了填补大规模TIR数据集的空白,Hu等[103]应用CycleGAN[104]从可见光图像生成合成IR图像,扩展CVC-09数据集。

        领域自适应方法:在多光谱行人检测中采用领域自适应机制的关键思想是利用热图像中从色域获得的习得知识。在这方面,Guo等人[109]将重点放在图像级域自适应上,他们使用图像到图像转换器作为数据增强工具,将彩色图像转换为热光谱。

        无监督域自适应方法:无监督域自适应的目的是在不需要人工标注的情况下,使经过良好训练的可见图像检测器适应热目标。作为这一类的工作,Meta-UDA[118]使用在线元学习策略执行无监督域自适应(UDA)热目标检测,产生简短且易于处理的计算图。

        知识蒸馏方法:知识蒸馏(Knowledge distillation, KD)的概念是基于通过监督学习过程将从大型复杂的预训练教师模型中学习到的知识继承到小型简单的学生模型中[125],[126],[127]。一般来说,该方法的主要目标是转移数据的适用和有意义的表示,以加快学生模型的推理时间,而不会显著降低准确性[126]。

        记忆网络方法:记忆增强神经网络(Memory Augmented Neural Network, MANN)可以记忆和召回记忆模块中的先验信息,例如视觉外观,因此可以通过计算相似度来访问相关数据[129]。

3.2.3 基于图像规范的方法

        另一类侧重于图像规范发挥关键作用的方法。这些方法可分为三种主要策略:图像增强、图像到图像的转换和显著性映射方法。

        图像增强方法:TIR图像的特点是细节噪声大、边缘模糊、对比度低、分辨率低,导致低分辨力导致性能下降。在这方面,低光图像增强技术被认为可以提高热图像的视觉质量,并简化其挑战。Marnissi等人设计了一种基于图像结构的增强方法,称为热增强GAN (TE-GAN),它由对比度增强、噪声消除和边缘恢复组成。DIVFusion将低光图像增强任务和双模态融合任务合并在一个统一的框架中,以研究光照条件对图像融合的影响。

        图像到图像的翻译方法:图像到图像(I2I)翻译模型的目标是学习源域和目标域之间的视觉映射,同时保留基本特征。具体而言,I2I已广泛应用于图像着色、去噪和合成。在这些方法中,热图像着色的目的是从温度通道域转换到RGB通道。在中提出了PearlGAN,以促进夜间热红外(TIR)图像转换为日间彩色图像。PearlGAN利用自上而下的注意力引导模块和相应的注意力损失,通过上下文信息产生分层的注意力分布,减少IR图像中的局部语义歧义。此外,还设计了结构化梯度对齐损失,以增强翻译过程中的边缘一致性。热红外图像在行人检测应用中的着色是由[144]完成的,分为三个主要模块:热图像着色、着色图像的改进和行人检测。使用预训练的YOLO v5框架将彩色和改进的图像馈送到检测头。

        显著性图方法:显著性物体检测的目的是突出给定图像中最显著的区域,并利用每个像素的强度将突出物体与周围环境区分开来。因此,在TIR图像中,显著性图可以用来检测温度。Altay等人[149]提出了一种双分支架构,可以将热图像的特征与其相关的显著性图结合起来,以获得更好的行人区域表示。Ghose等人[150]没有在融合网络中使用彩色热图像对,而是建议用热图像的相应显著性图来增强热图像,这些显著性图是由静态方法和两个深度显著性网络生成的,即像素化上下文注意网络(PiCANet)和循环残差细化网络(RRRNet)。

3.2.4 基于图像差异的方法

        这些方法旨在通过利用图像内的差异和不同成像传感器的特征以及分析图像质量和内容的变化来提高夜间行人检测的准确性和可靠性。通过关注模态不平衡问题和位置移位问题来缓解模态差异。

        模态不平衡问题:当一个传感器的表现明显优于其他传感器时,可能会导致训练偏向于一个主导输入模态。例如,在多模态学习中,训练数据的不均匀分布导致网络训练过程中非主导输入模态的贡献较小,因此限制了模型的可泛化性。在这方面,Oksuz等人[155]对目标检测中的不平衡问题进行了全面的分类。他们将这些问题分为四大类:类不平衡(即训练数据在不同类之间的不平等分布)、尺度不平衡(即物体的各种尺度)、空间不平衡(即边界框的空间属性)和客观不平衡(即多个损失函数的最小化)。

        位置移位问题:不同相机的物理特性(例如,视场(FoV),分辨率,波长等)可能导致多光谱数据中的弱对齐图像对,其中物体的位置在不同模态上不同步。一些作品试图通过几何校准和图像对准方法来解决多模态传感器中提到的问题。Zhang等人的研究[163]是第一个对彩色图像和热图像之间的位置移位问题提供见解的工作。他们引入了一个对齐区域CNN (AR-CNN)检测框架来解决弱对齐图像对。

3.2.5 多任务方法

        多任务方法:多任务学习是一种训练范式,旨在使用共享特征表示同时学习多个相关任务[167]。[168]提出了一种跨任务特征对齐方法,通过在跨任务学习的特征融合和共享步骤之前放置四个特征对齐层,来解决来自图像重照明和行人检测任务的特征尺度和通道的不对齐问题。同时,多尺度特征增强的检测网络扩展了多尺度特征提取器的接受域,从而为检测头提供了更丰富的融合特征语义信息。

3.2.6 其他方法

        对于最后一个类别,本小节介绍了无法归入前面类别的作品。[174]的作者采用了Faster R-CNN架构中的区域分解分支,利用头部、躯干、腿部等多区域特征来解决热图像中的行人遮挡问题。中心和尺度预测网络(CSPNet)[175]在[176]中得到了三种IR行人检测模型,即白天、夜间和全职。Xu等人[177]将地面区域上下文信息聚合到用于行人检测的Faster R-CNN中,并将预测的地面地平线区域共享给地面区域建议网络(ground- region Proposal Network, GRPN),该网络只能处理提议的地平线区域上的像素,以最小化假阳性(False Positive, FP)率。

3.3 混合方法

        混合方法结合了手工特征和深度学习的元素,旨在利用每种方法的优势来提高夜间行人检测性能。相应地,它们比深度学习方法所需的计算资源要少得多,并克服了手工方法泛化性差的问题。然而,这些方法的性能在预测精度或模型运行时间方面并没有得到适当的优化。

        作为夜间行人检测的混合方法,Kim等人[183]的研究提出了一种使用可见光相机和Faster R-CNN模型在夜间检测行人的方法,该方法可以通过融合连续帧中的深度卷积特征来处理行人空间位置的变化。为了提高模型对噪声和光照的鲁棒性,作者采用加性随机高斯白噪声(AWGN),并采用像素归一化和直方图均衡化(HE)均值减法两种预处理方法对连续帧的光照和对比度进行归一化处理。此外,还增加了连续帧特征的加权求和,以利用行人的时间信息,从而提高了夜间行人检测器的准确性。为了在CNN中找到最佳的融合阶段,[184]作者使用RPN将视觉图像和IR图像的特征进行融合。在RPN中进行半特征融合后,采用提升决策树(boosting Decision Tree, BDT)分类器提高行人检测结果,降低误报率。Tumas等人[185]消除了滑动窗口技术,并应用背景减法提取热活跃点作为兴趣区域(ROI),用于远红外(FIR)域的行人检测。

4、讨论

4.1 使用的方法趋势

        夜间行人检测方法可以分为手工特征、深度学习和混合方法。近两年发表的大部分作品都认为基于深度学习的技术是在弱光条件下检测行人最可靠的方法。换句话说,最近的方法只专注于使用深度神经网络,而不是手工制作和混合方法。主要原因可能是深度神经网络中特征的自动学习,它涵盖了许多可能的条件,在这些条件下行人很难被检测到。此外,这些作品越来越实用,提供了在实际应用中使用的可能性,而基于手工制作或混合方法制作特定领域的应用并不是一个实用的解
决方案。

        大多数论文都有针对夜间行人检测应用的图像融合技术。由于热成像(即长波长IR)可以捕获物体的红外辐射,并且对温度变化敏感,因此在光照不足的情况下,热成像可以提供更清晰的行人轮廓信息。然而,热IR模式缺乏视觉细节,如纹理、颜色和物体的精确边缘,这些可以被RGB传感器捕获。此外,在恶劣的天气条件下,低分辨率和不利的照明条件下,可见图像的质量会明显下降。考虑到可见光和热传感器的特性,交叉光谱融合已经成为克服单峰方法的局限性,以适应全天候和全天情况的一种有前途的替代解决方案。通过融合来自多个模态的互补视觉特征,增强了行人探测器的稳定性、可靠性和可感知性。尽管在多光谱行人检测方面取得了很大的进步,但目前的人工视觉系统与人类的视觉能力仍然存在很大的差距。其中,中途融合覆盖了大部分工作,后期融合是图像融合子类别中第二首选的方法。根据图中的统计数据,知识转移和图像规范方法论是以下的潮流解决方案。也可以看出,在近年来该领域发表的论文中,多任务方法并没有引起大量的关注。

        三种基于深度学习的架构致力于实现多光谱行人检测,可分为传统的基于cnn的架构,基于Auto-Encoder (AE)的架构和基于gan的架构。图9简要展示了这些方法和架构的分布情况。因此,端到端基于cnn的方法通过精心设计的损失函数和网络架构,包含特征提取、特征融合和图像重建过程。另一方面,基于ae的方法首先训练编码器以及解码器分别作为特征提取器和图像重构器。然后,根据融合规则完成多图像融合处理。最后,在基于gan的方法中,该架构依赖于生成器和鉴别器之间的对抗机制,适用于无监督行人检测。鉴别器迫使生成器使融合图像中的目标分布尽可能接近源图像。

4.2 数据集趋势

        大部分论文(约占一半)都使用了KAIST数据集。其他研究作品使用的第二和第三个数据集分别是FLIR和CVC-14。应该提到的是,一些研究作品(即~ 5.3%)更喜欢评估他们内部收集的数据,主要是从现实世界的场景中收集的。

5、结论

        手头的论文提供了针对弱光条件量身定制的行人检测方法的全面调查,解决了计算机视觉,监视和自动驾驶中的关键挑战。在能见度降低的情况下对行人进行准确可靠的识别和跟踪,对于提高自动驾驶车辆的安全性和预防事故至关重要。调查显示研究了一系列广泛的方法,包括基于深度学习的、基于特征的和混合的方法,这些方法在改善具有挑战性的照明场景下的行人检测性能方面显示了有希望的结果。通过深入研究当前低光行人检测的现状,这项工作有助于推进更安全、更可靠的自动驾驶系统和其他与行人安全相关的应用。它还确定了该领域正在进行的研究方向,并强调了值得进一步研究和调查的潜在区域。本文提供的见解旨在为未来的工作提供信息和启发,最终推动不
利条件下行人检测领域的创新和进步。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐