深度学习+激光条纹线结构光:点云三维重建关键技术与进展综述
点击下方卡片,关注「3D视觉工坊」公众号
选择星标,干货第一时间送达
来源:3D视觉工坊
「3D视觉从入门到精通」知识星球(点开有惊喜) !星球内有20多门3D视觉系统课程、3DGS独家系列视频课程、顶会论文最新解读、海量3D视觉行业源码、项目承接、求职招聘等。想要入门3D视觉、做项目、搞科研,欢迎加入!
摘要
基于激光条纹的线结构光点云三维重建技术具有非接触、精度高、鲁棒性强等特点,能够满足复杂环境下的测量需求,被广泛应用于机器视觉、零部件的尺寸测量和缺陷检测等领域。然而,传统的基于激光条纹的线结构光点云三维重建方法依赖于复杂的相位提取和视差计算,对环境噪声和物体表面特性敏感,且计算过程繁琐,会导致重建精度低、速度慢和适用范围受限等问题。近年来,深度学习的引入为该领域带来了突破,并逐渐成为研究热点,但该领域目前还缺少对深度学习方法在基于激光条纹的线结构光点云三维重建中的应用的全面综述和分析总结。因此,结合基于激光条纹的线结构光点云三维重建技术各步骤的特点,全面分析和总结了深度学习技术在激光条纹图像预处理和端到端的激光条纹中心线提取,以及点云处理步骤中的点云过滤、上采样和配准三个部分的研究进展及面临的挑战。最后,从构建数据集、优化深度学习网络、实验结果高质量定量评价和推动技术应用于实际场景等方面展望了未来的研究热点和应用前景。
作者:周上善 ,蒋文波
单位:1西华大学电气与电子信息学院;2西华大学四川省信号与信息处理重点实验室.
1 引言
1.1 目的和意义
三维重建的核心思想是通过多视角几何,利用来自不同视角的多张二维图像来推断场景或物体的三维结构。三维重建方法按传感器是否主动向物体发出照射信号分为主动式和被动式两种。被动式三维重建技术包括立体视觉、阴影恢复形状法;主动非接触式三维测量方法包括结构光法(Line-structured Light)、飞行时间法(Time of Flight)、莫尔条纹法(Moire fringes),而结构光法又可以分为线结构光,面结构光,散斑,相移等。
线结构光法具有测量精度高、速度快、易于实现、环境适应性强和能避免接触式测量可能带来的误差和对物体表面的损伤等优点,在建筑工地、工业产品、地质调查、医疗采集信息、文物保护等领域都展现出广泛的应用潜力。而基于激光条纹的线结构光点云三维重建通常分为激光条纹中心线提取、系统标定和点云处理三个主要步骤。然而,现有的深度学习在线结构光系统标定领域的研究相对较少,故暂不讨论深度学习在系统标定这一步的应用。除此之外,深度学习在激光条纹中心线的提取和点云处理两个步骤的研究相对深入,并且这两个步骤产生的误差会显著影响三维重建的精度,因此本文将重点讨论深度学习在这两个部分的应用。
传统激光中心线提取方法依赖图像质量,易受噪声和光照不均的干扰,适应性差且精度有限。灰度重心法、曲线拟合法和极值法通常要求激光条纹灰度分布呈理想的高斯分布,但实际效果常受噪声影响。方向模板方法因模板方向限制准确性降低,且易受物体表面粗糙度的影响。Steger方法计算量大且效率低,不当的高斯核选择会导致图像信息失真。山脊跟踪法和阈值法也对噪声敏感,容易受到干扰。
点云处理主要分为点云过滤、点云上采样和点云配准三步。首先,传统的点云过滤算法不适用于大型场景,远离传感器的区域信号点稀疏,使得环境特征数据丢失,降低了点云的精度和召回率。其次,点云上采样的传统基于优化的方法也因数据的无序性和不规则性而面临新点生成的困难,难以确保新点均匀分布并维持几何一致性。最后,传统的刚性点云配准方法包括四点一致集算法(4PCS)快速全局配准和迭代最近点算法(ICP)及其变体。其中,4PCS由于高时间复杂度,限制了其在大规模空间数据中的应用效果;ICP更关注局部信息,在点云不同相位或视角存在较大初始误差时,难以在大尺度场景中收敛。
然而,深度学习对复杂背景和噪声数据的适应性强,通过大量有噪数据训练,模型能学习到真实特征,提升激光中心线提取的准确性和点云处理效果。同时,深度学习模型在处理大规模数据时,凭借并行计算和优化算法,可实现高效运算,满足实时性需求。针对测量依赖稳定环境的情况,深度学习不依赖环境和光照,提高了测量的稳定性和可靠性。与传统方法相比,深度学习能从大量数据中挖掘复杂特征,有效克服传统方法依赖人为设计特征的局限。因此,深度学习方法逐渐成为基于激光条纹的线结构光点云三维重建领域的重要发展方向。
由于目前深度学习在基于激光条纹的线结构光点云三维重建领域中的应用还处于初步阶段,并不成熟,本文重点对深度学习在基于激光条纹的线结构光点云三维重建中的激光条纹中心线提取和点云处理步骤中的研究现状进行了详细总结,对比了不同深度学习方法之间的性能,以及其在解决传统方法所面临的问题时展现的潜在优势,最后对本领域的发展趋势进行了展望,希望为该领域的研究人员在后续的研究中提供帮助。
1.2 基于激光条纹的线结构光点云三维重建原理
基于激光条纹的线结构光点云三维重建系统如图1所示。基于激光条纹的线结构光点云三维重建方法利用激光光源生成一定规律的条纹,并将其投射到待测物体表面上。由于物体表面的形状特征,投射的线条会发生变形,不同的三维形状会导致线条在不同的位置和角度发生不同程度的弯曲或扭曲。使用成像设备捕捉物体表面受到光线照射后的图像,通过提取图像中激光条纹的中心线,可以得到三维空间中特定平面内重建物体的特征坐标。然后结合相机的内外参数进行系统标定,将二维像素坐标映射到三维空间,得到原始的点云数据。最后,对得到的原始点云数据进行点云过滤、上采样和配准处理,通过3D形状表示可以得到完整的目标物体3D重建模型。基于激光条纹的线结构光点云三维重建流程如图2所示。
2 深度学习在激光条纹中心线提取的应用
在理想条件下,相机捕获的激光光条的横截面亮度分布满足高斯模型,可以提取出光条横截面上最亮的像素点,这些像素点就构成了激光光条的中心线。中心线兼具了激光光条的局部特性和全局特征,因此在进行图像采集时,需要选择合适的拍摄角度和相机曝光时间来确保条纹效果清晰可见。
采集图像后,需要对激光条纹进行中心线提取。基于深度学习的激光条纹中心线提取方法分为两类,其流程如图3所示。第一类提取方法是先对图像使用深度学习进行预处理操作,此阶段包括图像的去噪、识别或修复,然后进一步使用传统中心线提取方法进行提取。第二类中心线提取方法是使用深度学习直接端到端地提取激光条纹中心线。然而,目前针对使用深度学习网络对激光条纹中心线进行端到端提取的研究较少,应用于激光条纹中心线提取的大部分深度学习网络主要体现在激光条纹图像的预处理操作中。
2.1 利用深度学习进行激光条纹图像预处理
2.1.1 激光条纹图像去噪
在激光中心线提取过程中,常常面临多种非理想环境条件,导致光条强度受到调制,不再严格符合高斯分布,增加了光条中心提取的难度,例如:当激光照射到粗糙表面时,表面的漫反射会导致光场分布不均匀;当相机与物体之间的距离,或投影光带之间的距离相对较小时,镜面反射和漫反射的影响则更加明显,进一步导致光条横截面的光强分布偏离标准高斯分布,因此进行激光条纹图像去噪非常重要。
噪声可以根据其影响因素分为不均匀漫反射、镜面反射、反射干扰、间歇条纹、噪声背景、弧光和飞溅噪声等,常见激光条纹图像噪声类型如图4所示。为了有效处理激光条纹图像中的噪声,当前主要应用的去噪算法可以分为两大类:滤波算法和形态学算法。尽管这些滤波器能够去除由电子设备引起的某些类型的噪声,但形态学方法对由对象遮挡或镜面反射引起的噪声几乎无法去除。此外,在复杂背景下处理图像时,这些去噪方法也可能产生意外错误。
传统方法主要面临的问题有:1)存在泛化性和鲁棒性差的缺点,在实际工业应用中容易受到相当大的图像噪声的影响;2)激光条纹由于其不均匀的特性,传统方法难以对其实现完全分割;3)通常需要手动设计功能,非常繁琐。
针对问题1,Fang等使用卷积自动编码器(CAE)去噪方法来恢复深度传感器损坏的激光条纹图像。该方法可以直接应用,也可以通过细微修改来实现对来自其他结构光系统的激光图像的恢复,对深度传感器的激光条纹图像泛化性良好。Zhao等提出了一种激光条纹检测神经网络(LSDNN),可以消除反射噪声和雾霾噪声的干扰,在复杂环境中更加准确和鲁棒。对于焊缝图像去噪,Yang等使用深度编码器-解码器网络框架,加入残差双向ConvLSTM块(BiConvLSTM)来增强模型从局部特征图中学习多尺度和远程空间上下文的能力。Zou等提出的轻量级分割网络SOLOv2则是利用图像分割进行去噪,且相比于原来的SOLOv2参数量由 减少到 ,能够在强噪声下准确分割激光条纹,且满足焊缝跟踪的实时性要求。
针对问题2,Jiang等利用了多尺度注意力U-Net式架构从复杂的背景环境中分割激光条纹,该模型平均执行时间非常高效,为0.125 s。Mao等将DeepLab中提出的扩张卷积核引入ConvNeXt和CBAM的卷积核中,mIoU在原ConvNeXt基础上提高了0.82%。ConvNeXt网络的改进结构如图5所示。Yang等提出的方法在激光条纹信息较弱或由于镜面反射和轴件曲率大而产生较强干扰时有较好的噪声抑制能力。如图6所示,相比之下,Steger算法在提取轴边缘条纹中心时效果较差,在强反射噪声条件下容易出现冗余干扰。而Du等将Transformer语义分割网络与传统方法融合,与卷积神经网络(CNN)相比,Stripe-Segmentor更轻量化,计算效率更高。
针对问题3,Chen等提出了一种称为GuideNet的语义分割方法,设计了Guidance模块用于引导特征提取,提出的网络结构如图7所示,存在的缺点是在多次高反射场景下可能无法准确区分激光条纹和反射的细微差异,导致误分类和条纹损坏。Yu等将PSPNet应用于缝合线结构光条中心线的提取过程,不需要手动设计。与SegNet算法和U-Net算法相比,PSPNet具有更好的抗干扰能力。Ye等建立了基于特征融合和注意力机制的U-Net分割模型。提出的算法在曲率变化时,相较于Steger算法提取的激光条纹中心容易出现条纹断裂,提取的点云数据不平滑的情况,能更好地反映工件的三维形状特征。
基于深度学习的激光条纹图像去噪方法结果如表1所示,其中去噪性能评价指标,即峰值信噪比(PSNR)、Dice指数和平均交并比(mIoU)的计算公式如式(1)~(5)所示。针对不同噪声问题,各网络通过深度学习方法与传统方法相结合和仅使用深度学习方法达到了良好的去噪效果,但文献[26]所提出的ConvNeXt网络的去噪效果并不理想。


虽然深度学习方法展现出更强的适应能力,但这些方法还存在限制:1)网络设计普遍忽视激光条纹的物理成像特性,如高斯能量分布规律和光强衰减特征,导致去噪后的条纹剖面失真;2)在处理实时性要求较高的工业场景时,网络计算复杂度与实时处理需求之间的矛盾日益凸显,现有方法在面对工业现场复杂的噪声组合时表现欠佳;3)环境光渐变、电火花脉冲和金属纹理伪影往往同时存在,而当前网络架构缺乏对噪声类型的自动识别和差异化处理能力,这种“噪声多样性对网络架构处理单一性”的矛盾严重制约了算法的实用性能。
2.1.2 激光条纹图像识别
目前,激光条纹图像识别主要应用在轨头和轨腰区域识别、焊缝关键点跟踪识别和焊接缺陷检测等方面,其中传统的缺陷检测可分为人工检测、破坏性检测或无损检测方法。而基于线结构光的检测相比于其他方法具有精度高、硬件紧凑、采样率高等特点,被广泛用作焊缝表面缺陷的优良无损检测方法。传统方法主要存在的问题有:1)不适用于结构条件复杂多变的高速列车钢轨的部位识别;2)设计需要大量人工干预,且通常被认为是主观的,依赖专业知识;3)条纹仅根据灰度和边缘等传统特征提取,难以在整个图像块中自动、稳健地提取占比低的激光条纹信息。
针对问题1,Wang等提出一种多尺度多通道深度神经网络框架Sketch-a-Net。然后采用模板匹配驱动的时间和空间上下文跟踪算法来实现对轨头激光条的快速跟踪。该方法有效解决了道口过车的轮廓测量问题,实现了各类激光条的准确定位和快速跟踪。针对问题2,Xiao等整合CNN与Transformer架构,构建出自监督全局-局部特征提取网络(SSGLNet)。与监督学习不同,该网络通过无监督学习得到的卷积核呈现出更为显著的多样性,能够涵盖广泛的特征范围,进而提升模型在后续任务中的表现。针对问题3,Liu等设计了一种用于激光条纹自动检测的CNN网络,解决了可能存在不完整和不均匀的特征和非激光条纹斑块复杂多样、具有较多的干涉特征、亮度范围变化较大等问题。图8为该网络的识别结果。
基于深度学习的激光条纹图像识别方法结果如表2所示,其中评价指标,即精确度(Acc)、 分数的计算公式如式(6)~(9)所示。其中,仅SSGLNet网络用于特征提取步骤,另外两种方法的识别准确率都较高,分别达到了98.20% 和97.24%。


这些深度学习方法也存在一定局限性:1)现有网络对激光条纹的物理特性建模不足,特别是缺乏对光强分布规律和三维几何约束的显式考虑;2)在实时性要求严格的工业场景中,网络计算复杂度与识别速度的矛盾日益突出,如复杂网络推理延时可能无法满足在线检测需求;3)当前方法对极端工况(如强飞溅、重度氧化表面)的适应能力仍然有限,模型泛化性能有待提升。工业现场的微小缺陷识别需要亚像素级精度,而不同材质表面的光条纹表现差异显著。
2.1.3 激光条纹图像修复
基于传统算法的图像修复主要根据图像已有区域和待修复区域之间的图像块信息的相似度来执行修复过程,根据具体执行原则的不同,传统算法可以分为基于扩散的图像修复和基于样本的图像修复。该类算法的最大问题是当外部数据库中不存在与待修复区域相似的图像时会出现修复错误的情况。传统修复算法的缺点可以总结成:1)无法适应缺陷的多样性,对外部数据库存量的依赖大;2)耗费大量计算资源和时间;3)在强干扰背景下鲁棒性差。
应用在激光条纹图像修复的基本网络有基于循环特征推理网络(RFR-Net)和生成对抗网络(GAN)。针对问题1,Liu等提出了一种基于条件生成对抗网络(CGAN)原理并采用U-Net网络模型作为基本结构的恢复和提取网络REN可以恢复接缝特征信息并准确提取接缝特征点。Guo等提出了一种轻量级U形分割模型URS,对多线条纹图像中的各种缺陷进行分割后修复。其参数量为 ,在耀斑处的mIoU处为85.91%,在带状裂缝处为92.93%,在精度和轻量化要求之间取得了平衡。
针对问题2,Ji等提出了一种轻量级高精度修复模型,该模型由带有幽灵卷积的递归相似性网络(RSG Net)组成,以去除光斑并修复局部断裂。该网络的基线网络模型是Li等提出的基于循环特征推理网络(RFRNet)的模型,根据灰度图像的特性优化了RFR-Net的相似机制。所提出的RSG-Net相对于基线方法对光斑的去除、局部断裂的修复、细节的保护,以及形状保持方面都明显更优越,也更加轻量化。图9为不同模型之间具有大条纹黏附区域的轮对图像的修复结果比较。
针对问题3,Zou等构建了焊接图像修复网络,修复速度约为32 frame/s,满足跟踪模型对训练样本实时净化的要求,同时很好地解决了焊缝跟踪模型的漂移问题,抑制了强噪声引起的过大定位误差,提高了焊缝跟踪精度。图10为文献[40]含噪焊接图像的修复结果。
基于深度学习的激光条纹图像修复方法结果如表3所示,其中平均绝对误差(MAE)和结构相似性指数(SSIM)的计算公式如式(10)、(11)所示。深度学习在激光条纹图像预处理方面的评价指标非常零散,且每个研究使用的数据集均不同,难以直接对比,因此该领域的评价指标规范问题亟待解决。


这些深度学习方法仍存在一些不足之处:1)基于GAN的方法擅长生成视觉连贯的修复结果,但存在模式崩溃风险;基于U-Net的方法保持了结构准确性,但对复杂噪声适应性有限;基于物理仿真的方法虽结果可靠,但计算成本较高。2)随着计算能力的提升和高效算法的研发,深度学习在激光条纹图像的实时处理性能方面有望进一步提高,尤其是在工业自动化和在线检测中,实时分析将大幅提高生产效率和质量控制。
2.2 使用端到端深度学习直接提取激光条纹中心
目前,虽然许多学者试图引入深度学习方法,但大多数都是用于提取激光中心线之前的图像预处理步骤,不能直接提取激光条纹的中心。这些方法的结果通常取决于深度学习预处理的效果,并且会消耗大量时间,因此,有部分学者开始探索运用深度学习方法对激光条纹中心线直接进行端到端的提取。
Yang等提出了一种基于编码器-译码器网络的火车轮对激光曲线分割算法,能够准确提取火车轮对的激光条纹。Luo等提出了一种骨架提取网络,即分层骨架网络(LuoNet),所提出的架构具有编码器-解码器网络的三个层次,在编码器和解码器网络的每个层次之间设计了YE Module互连。与传统的激光条纹中心提取算法相比,所提出的LuoNet算法具有运行时间短、准确率高、提取结果稳定等优点。图11为LuoNet方法与GGM、Steger、Zhang-Suen方法提取结果的比较。
现阶段端到端直接提取的深度学习网络主要是基于编码器-解码器结构进行图像分割。基于深度学习的激光条纹中心端到端提取方法结果如表4所示,encoder-decoder网络相较于LuoNet在分割性能上具有更高的准确性和有效性。这些网络在整体性能上都还有很大的提升空间,未来可以定性比较两种网络在同一数据集条件下的性能。
现有的基于深度学习的端到端提取方法也存在一定的局限性:1)网络设计方面,主流的编码器-解码器结构虽然擅长捕捉局部特征,但对激光条纹的全局连续性约束缺乏建模能力;2)训练策略方面,普遍采用的像素级损失函数难以有效约束亚像素级的中心定位精度;3)评价体系方面,当前主要依赖mIoU、 分数等通用指标,缺乏针对激光测量特性的专项评估维度(如光强梯度保持度、三维重建一致性等),这种评价导向的偏差使得算法优化可能偏离实际工程需求,需要进一步完善。
2.3 本章小结
在激光条纹中心线提取部分,现阶段的深度学习方法大多应用于激光条纹中心线提取的图像预处理步骤,而很少用于端到端直接进行提取,其原因主要是预处理步骤相较于端到端直接提取更为灵活。但其后续还需要用特定方法进行最终提取,流程较长,容易导致累积误差,增加了中心线提取难度,适合图像质量较差但需要高精度的情况。
端到端方法更高效,但依赖数据质量和数量,且在极端情况下的泛化能力可能不足,适合对实时性要求高且数据充足的情况。现阶段图像预处理加传统方法较为成熟可靠,但随着数据集的完善和模型优化,未来将趋向于端到端方法。
3 基于深度学习的点云处理方法
通过激光条纹中心线提取获得的是二维图像特征点,这些特征点需要通过系统标定转换为三维点云数据。然而,直接生成的点云数据通常存在噪声、稀疏性和多视角不一致等问题,因此需要进一步的点云处理来优化三维重建结果。本节将系统讨论基于深度学习的点云处理方法,这些方法与中心线提取技术共同构成了完整的线结构光三维重建流程。
激光条纹中心线提取阶段产生的误差会直接传递到点云数据中,如表5所示,例如:中心线提取的位置偏差会导致点云空间坐标偏移;条纹断裂会造成点云拓扑不连续;而图像噪声则会转化为点云离群点。因此,点云处理算法需要针对这些特定问题设计解决方案:1)点云过滤主要解决噪声传递问题;2)点云上采样处理数据稀疏性和不连续性;3)点云配准校正多视角间的系统误差。
3.1 基于深度学习的点云过滤方法
获取的点云图像会受到大量噪声的影响,例如孤立的异常值、聚集的噪声和信号附近的噪声点,在靠近传感器的区域,噪声点往往会聚集在一起,因此需要对通过系统标定后得到的原始点云数据进行过滤来去除噪声或不必要的点,以提高后续处理阶段的效率和结果质量。传统的点云去噪方法基于信号处理或者几何学理论,结合特征描述子估计点云的边界点和法线位置,调整点的坐标信息,以去除噪声。根据应用场景的不同,可以大致分为对大型场景和小型物体的点云过滤。
传统的点云去噪方法在过滤大型场景和小型物体的点云时往往存在缺点:1)地形适应性有限;2)传统滤波算法滤波精度低或模型复杂度过高;3)依赖几何先验和噪声特性,在非特定情况下表现不佳,且不能有效地消除非异常形式的反射噪声;4)参数调整复杂,难以获得最优算法和参数;5)无法保留清晰的几何特征。根据基础网络的不同,将基于深度学习的方法分为基于Transformer、基于CNN和基于PointNet三类进行阐述。
3.1.1 基于Transformer的点云过滤方法
针对问题3,Gao等提出的方法将大规模高密度点云转换为距离图像,随后使用深度学习方法和多位置传感器比较方法进行噪声检测。该方法克服了深度学习网络无法处理大规模高密度点云的局限性,同时使用深度学习对仅包含单回波反射值的大型点云进行降噪。去噪结果如图12所示。
3.1.2 基于CNN的点云过滤方法
针对问题1,Wang等提出一种基于多尺度卷积神经网络结合注意力机制的激光雷达点云滤波方法。可以进一步自适应地调整每个通道层和不同空间区域的权重,这使得网络训练更具针对性。Chen等提出了语义一致性卷积神经网络(SC-CNN),可以应用于通过光学图像的密集匹配获得的3D点云。但其缺点是设计的增材制造模块需要大量的训练时间和计算资源。
针对问题2,Liu等提出了采用多任务视角的点云降噪端到端框架PCDNF。特征提取器利用DGCNN作为主干,以多尺度方式学习点和法线特征表示。Heinzler等提出的方法与先进的几何过滤相比,性能有显著提高。
针对问题5,Lu等提出的方法用到两种CNN网络。首先使用了lenet区分特征点和非特征点,其次采用ResNet网络为主干进行正常估计。Parsons等使用传统和CNN过滤方法在LiDAR应用中进行灰尘过滤。与最好的传统滤波器相比,CNN滤波器可以实现高达5.39% 的 分数提高,达到了87.24%。
基于CNN的点云过滤方法如表6和表7所示,分为针对非地面情况和地面情况,是在各自的数据集、不同噪声水平下的实验结果。其中I类误差(T.I)、II类误差(T.II)和总误差(T.E)计算公式如式(12)~(15)所示。表6总结了各方法的创新性。表7中数据显示出MSCNN-AM在识别地面点时的精确度更高,而SC-CNN更能处理非地面点的准确分类。在整体性能上MSCNN-AM优于SC-CNN。


PointNet通过多层感知器进行特征提取,使其能够直接处理无序的点云数据,适用于不规则域的三维数据处理,计算资源需求相比于Transformer更小。虽然PointNet和Transformer方法能够提取全局特征,但对局部结构的捕捉能力较弱。尤其是PointNet没有考虑到点云的局部结构,导致其识别细粒度模式的能力较差。相比之下,CNN在规则网格数据的处理上具有更强的局部结构感知能力和层次化特征提取能力。
3.1.3 基于PointNet的点云过滤方法
针对问题3,Luo等提出了一个类似自动编码器的神经网络,称为DMR。该网络从具有微小噪声扰动的可差分子采样点及其嵌入的邻域特征中学习噪声点云的基本流形。
针对问题4,Wang等提出了名为PointFilterNet (简称PFN)的过滤网络,通过学习的系数生成过滤去噪点。PFN输出三个系数向量。然后将这些系数向量用于过滤噪声点附近点的坐标。与DMR相比,PFN在PCN数据集上的倒角距离减少了22.07%,且参数量仅为 。
针对问题5,Rakotosaona等提出的PointCleanNet (简称PCN)基于改编自PCPNet的深度学习架构。Zhang等提出了一个用于特征保留点云过滤的Pointfilter框架(简称PF)。在同等条件下PF的运行时间能达到63.55 s,相比于PCN的365.62 s更快,该架构训练难度较低。图13为PFN、PCN和DMR三种方法在Kinect Fusion数据集上的颜色编码降噪结果对比。
基于PointNet的点云过滤方法总结如表8所示,其中PFN、PCN和DMR的Chamfer Distance是在PCN数据集上,噪声水平在0.5%下的结果,其计算公式如式16所示。从表8和图13中的结果对比可以看出,PF网络的表现最好,实现了最低的CD值。PCN和DMR可以更好地保留细节纹理。但是,颜色编码误差表明PFN的性能优于所有比较方法。
基于深度学习的点云过滤方法目前还存在不足:
1)在数据表征层面,点云的非结构化特性与深度学习要求的规整输入之间存在根本矛盾,现有解决方案各有局限:体素化方法的计算复杂度与分辨率呈立方关系,难以处理大规模场景;直接处理点集的方法虽保持几何完整性,但对局部特征的捕获能力不足。
2)在物理约束方面,当前网络普遍忽视三维测量的特殊性,如传感器噪声具有各向异性,而现有方法仍采用各向同性假设,且点云密度随距离衰减的规律也未被有效建模。
3.2 深度学习在点云上采样方法中的应用
目前的点云上采样方法大致可分为两类:基于优化的方法和基于深度学习的方法。相对基于优化的方法而言,基于深度学习的点云上采样方法更加灵活。其中,三段式点云上采样是最常用的初始主流方法。随后,出现了一些结合离散微分几何和生成模型与深度学习的方法,这些方法旨在更有效地处理复杂几何形状和稀疏数据,从而提升上采样的效果和准确性。图14为三段式点云上采样方法结构。
传统方法存在的问题有:1)对局部特征的敏感性不足,保持几何特征的能力有限;2)无法有效处理非均匀点分布和高细节信息,精度低,效率低;3)依赖特定的先验知识或假设;4)高计算成本和内存使用率。
针对问题1,Li等提出了由上采样网络和分类网络组成的语义点云上采样网络SPU,将点云上采样(PU)策略应用于语义稀疏点云(SPC)分类的语义提升。Tang等通过以多级方式插值高频点来补偿高频点,设计了MDFE单元来构建学习过程中特征之间的全局相关性,并设计了CCPT单元来构建局部通道相关性。HFCI-PU的参数量为1.313 MB,小于PUFAGAN的14.805 MB。HFCI-PU架构如图15所示。
针对问题2,Liu等提出了PUFA-GAN网络,其缺点是在处理局部稀疏点云时会在上采样结果中产生一些漏洞,对局部特征信息保留不到位。基于此,该团队在2024年作出了进一步改进,将点云上采样问题视为“局部填充”问题设计了PU-Mask网络。从视觉上看,PU-Mask生成了高分辨率的点云,这些点云在底层表面上显示出均匀的分布,并且没有局部噪声。相比之下,其他方法都面临噪声问题或显示局部几何不规则性。图16显示了PU-Mask网络和PUFAGAN网络对Bird和Sculpture点云的上采样结果,可以发现PU-Mask网络在处理非均匀点分布和高细节信息方面效果更好。
针对问题3,Liu等提出SPU-PMD网络,利用网格呈现的拓扑来指导点云上采样,通过渐进式网格变形实现自监督点云上采样。该网络能够改善均匀性,并恢复丰富的结构细节,在均匀生成和结构保持方面优于传统方法。Lim等通过在神经隐式表面上进行射线行进实现与域无关的点云上采样,解决了合成点云和真实扫描点云之间的域依赖性问题。但其上采样结果的质量,取决于查询射线和补丁的生成,不适用于某些复杂情况。
针对问题4,Zhu等通过优化Transformer模型的核心组件设计了LET-UP网络。该模型大大减轻了重量和激活大小,只产生了小于1%~2% 的精度损失,降低了存储空间和计算要求,并通过按位运算加速了模型推理。
基于深度学习的点云上采样方法结果如表9所示,其中HD(Hausdorff Distance)和P2F(Point-to-Face Distance)的计算公式如式(17)、(18)所示。在CD指标中,PU-Ray在匹配精度方面表现最佳,而SPUPMD表现较差。在HD中,PU-Ray、LET-UP和SPUPMD的值均低于 ,表明这三种方法在极端点的匹配精度上优于其他模型。在P2F指标中,PU-Ray表现最佳,表明其能在点云中提供最小的点到点距离。
基于深度学习的点云上采样方法面临的限制有:
1)在上采样机制方面,现有方法普遍存在均匀性与细节度难以平衡的问题:基于生成对抗网络的方法(如PU-GAN)能合成逼真点分布,但在特征边缘处易产生伪影;基于局部插值的方法(如PU-Mask)虽保持几何正确性,但对高频细节恢复不足。
2)在物理约束上存在缺失。当前网络大多忽视三维扫描的物理特性(如激光测距误差分布),导致上采样点虽视觉合理但测量精度不足。 3)在工业应用场景方面,难以满足实时性要求,例如PUFA-GAN虽能生成细腻几何,但940 ms的处理延迟难以满足在线检测需求。针对大场景密集重建的实时性要求,压缩模型加速是实现高效处理的一条可行策略。
3.3 深度学习在基于刚性变换的点云配准方法中的应用
传统的点云配准方法分为刚性配准和非刚性配准。刚性配准通过估计旋转和平移参数进行转换,保持任意两点间的距离不变,而非刚性配准则使用仿射变换、投影模型和薄板样条等模型来模拟更复杂的变换。由于非刚性变换模型和评估指标种类繁多,难以进行有效比较,故重点讨论刚性点云配准。
传统的点云配准方法存在的缺点有:1)针对大型场景点云配准存在与配准精度或计算效率相关的限制;2)会丢失一些关键信息;3)对初始条件敏感;4)在部分到部分点云配准中表现不佳。
针对问题1,Zhang等提出的DDRNet网络能够直接注册大规模场景的点云,而无需检测和匹配关键点。图17为DDRNet网络在3Dmatch数据集上准确性随重叠率的变化情况和与另外两种方法的结果对比,可以发现其在重叠比率的变化下更加稳健,但该网络在直接处理重叠量较低和室内场景的点云时性能不够好。Wang等提出的CCAG与传统的配准方法相比,可以更好地处理点云的几何结构和局部特征,解决了点云数据正则化、参数选择和设计问题。
针对问题2,Sun等提出了一个模块(名为MLP_GCN),融合了多层感知器(MLP)和图卷积网络(GCN)。该框架端到端生成判别性图深度特征和图注意力表达,并通过图注意力表达进一步自动确定关键点,以获得最终的高质量配准结果。Wu等将解码器与跳过注意力机制相结合设计了SACF-Net网络。该网络可以充分利用和保留局部区域的结构细节,使其能够有效地提取重叠区域内的高质量对应关系。
针对问题3,Kurobe等提出了CorsNet网络。由于CorsNet将局部特征与全局特征连接起来,并回归点云之间的对应关系,而不是直接姿态或聚合特征,因此比传统方法集成了更多有用的信息。Yi等使用DGCNN和注意力机制有效地提取了点云的多个特征的DOPNet。图18显示了DOPNet与其他方法的对比,其中第一列显示点云的初始位置,而其他列显示配准结果。可以发现,所提方法相较于CorsNet配准结果更加准确,且对于高度对称的结构、重复的结构、复杂结构等经常导致陷入局部最优或配准失败的情况,仍能取得较好的配准结果。
针对问题4,Li等利用VPGnet中的生成对抗网络(GAN)来生成最佳的缺失部分,有效地解决了在处理部分到部分配准时点云的偏颇性阻碍足够对应点的获取问题。Zhou等提出了基于部分点云配准的空间和通道注意力机制的SCANet网络,可以直接处理点云。该网络无需手工制作的特征、体素化、区域查询和对应,可以提高计算和存储效率以及对噪声和遮挡的鲁棒性,但无法应用于大尺度和复杂场景的点云。
基于深度学习的点云配准方法大致可分为两类:特征学习和端到端学习。特征学习方法旨在通过深度学习网络提取点云的特征表示,并结合传统优化算法进行配准。这类方法能够从点云数据中学习到更具表现力和稳健性的特征表示,从而提升配准性能。端到端方法则直接从原始点云数据中提取用于配准的转换参数,简化了特征提取和匹配的复杂性,同时提高了计算效率和鲁棒性。然而,这些方法仍面临一些限制:
表10为基于深度学习的点云配准方法总结,其中除MLP_GCN网络未使用旋转和平移后的数据外,其余网络的RMSE均是使用旋转和平移后数据获得的值。从表10中数据可以看出,MLP_GCN的推理时间最长,与其他网络相差较大,且在平移配准方面效果较差,不适用于实时或平移精度要求高的应用场景,SACF-Net-Sparse在旋转误差和平移误差上都表现优异,是一种综合性能较好的点云配准方法。
1)在特征表征方面,点云的非结构化特性与深度学习要求的规整输入之间存在根本冲突:基于体素化的方法导致几何细节损失,而基于原始点集的处理又难以建立高效的特征对应关系。
2)在优化机制方面,现有方法普遍存在局部精度与全局收敛性无法平衡的问题:基于局部特征的方法能实现亚度级旋转精度,但对初始位置敏感;基于全局回归的方法虽收敛域大,但最终配准误差是前者的3~5倍。 3)在实时性方面,虽然深度学习方法在点云配准搜索对应关系方面具有一定的优势,但还需要进行更多更深入的研究,寻找一种功耗低的绿色解决方案。这意味着需要一种具有更小的模型大小和更少的训练和推理时间的方法。
3.4 本章小结
在点云处理部分,所有步骤均需要大量数据训练、人工标注和选取不同的网络。CNN凭借捕捉全局上下文信息时表现较好,更适合大规模室外场景。PointNet因直接处理无序点云和轻量化特性,在室内小场景中更具优势。因此,需要综合考虑应用场景的特点和实际需求来优化网络结构和选择合适的方法,从而实现更快速、高效和精准的点云处理和三维重建。
4 总结与展望
构建全面的、多样性的数据集。训练激光条纹中心线提取的深度学习网络面临的一个主要问题是缺乏种类多样的公开数据集。现有的数据集往往仅包含特定研究团队需要的样本,类型种类太少,限制了模型的泛化能力。此外,由于点云数据采集的困难,现有的三维点云配准数据集数据量通常已经难以满足深度学习的发展需求,这导致研究成果之间缺乏可比性。针对实际应用场景,如焊缝跟踪、火车轮对监测、金属工件平面度误差和精密轴类零件三维测量等,可利用计算机图形学技术模拟真实场景中的复杂干扰,或搭建实验平台采集包含未知变量的激光条纹图像,以丰富训练数据集的多样性。同时如果在有条件的情况下,未来希望尽可能在真实场景中收集和制作高质量、高实用价值的激光条纹图像数据集。
优化深度学习网络。在端到端提取激光条纹中心线方面,可以考虑除编码器-解码器结构以外的其他深度学习网络的应用,例如基于图像生成网络CGAN,或结合无监督学习方法的网络的设计。在优化点云上采样网络方面,未来的研究应集中在优化点云上采样技术,以提高其在3D重建中的应用效果,可以考虑的优化方向有:注重任意上采样率和无监督学习方法的网络的设计,使模型在各种应用场景中更加灵活并减少对训练数据的依赖;结合机器学习与深度学习的方法,通过架构优化、算法协同或硬件感知设计等方法实现处理精准度和速度的平衡,从而推动智能交通系统等领域的实际应用;高频补偿滤波技术在提升点云质量方面具有潜力,可以关注补偿细节与减少噪声之间的效果;生成更精确和计算效率更高的本地补丁,寻找更有效的局部邻域搜索策略,如查询球或扩张的k-NN搜索;通过利用动态点云的时空相关性对动态点云进行上采样。
实验结果高质量定量评价。激光条纹中心线提取方法在评价指标方面存在局限性,对提取质量的定量评价和对比分析不足。目前,常用的评价指标多集中于提取精度和运行时间,但缺乏对提取结果的全面量化分析,不同方法之间的对比分析往往依赖于特定实验条件,难以进行通用性对比,不能充分反映方法在各种场景下的性能,因此建立完善的、高质量的激光条纹中心线提取和点云处理评价标准至关重要。未来可以考虑引入多维度评价指标、标准化测试数据集和协议和实际应用导向的评价。
推动技术应用于实际场景。尽管深度学习方法在真实场景的深度预测中展现出潜力,但实际应用仍面临计算资源和推理速度的挑战。研究人员应探索更高效的算法和硬件加速技术以满足工业标准。此外,深度学习在处理大规模室外点云和低重叠率场景时仍存在局限性。未来可通过引入上下文信息、时间序列数据、迁移学习和多视图学习框架使深度学习模型更好的应用于大规模点云场景和源点云与目标点云重叠率低于30% 的情况,在工程实践中有效处理点云部分到部分配准问题。此外,还可将这些技术应用于同步定位与地图构建(SLAM)和运动结构分析,提升机器人的自主导航、环境感知和交互能力,从而提升其在机器人应用中的价值。
本文仅做学术分享,如有侵权,请联系删文。
3D视觉方向论文辅导来啦!可辅导SCI期刊、CCF会议、本硕博毕设、核心期刊等。




添加微信:cv3d001,备注:姓名+方向+单位,邀请入群。
更多推荐


所有评论(0)