成像系统自动聚焦(AF)算法调研----扫盲
摘要
自动聚焦(Autofocus, AF)是现代成像系统的关键技术,直接影响图像采集质量与用户体验。本报告全面调研了自动聚焦算法的发展历程与技术现状,按照算法设计思想和演进脉络将其划分为四大类别:主动式测距法、被动式对比度法、相位检测法以及基于深度学习的智能化方法,并对每类算法的核心技术路线、代表性工作及优缺点进行了系统分析。报告进一步对各类算法的应用情况进行了多维度评估,涵盖对焦速度、对焦精度、硬件依赖、资源消耗与开发难度等指标。分析表明,目前行业主流方案为“混合对焦”:相位检测确定运动方向与粗略位置,对比度优化实现精细收敛,辅以激光雷达测距应对低照度与低纹理场景。深度学习方法在单次预测对焦和场景自适应方面展现出显著潜力,但受限于推理延迟和特定硬件依赖,大规模工程化落地尚需时日。最后,报告对自动聚焦技术面临的挑战和未来发展趋势进行了展望。
第一章 绪论
1.1 自动聚焦技术背景
自动聚焦是指成像系统在不依赖人工干预的条件下,自动调整镜头位置使目标场景获得最优清晰度的技术。随着数码相机、智能手机、安防监控、工业检测、医学显微成像等领域对成像质量要求的不断提高,AF技术已成为成像系统中不可或缺的核心组件。自动聚焦技术的性能直接影响成像系统的响应速度、成像质量和用户体验。聚焦不准会导致图像模糊、细节丢失,尤其在体育赛事、生态摄影、工业自动化等场景下,AF系统的精度和速度直接决定了设备的可用性。
1.2 AF系统基本工作原理
自动聚焦系统本质上是一个闭环控制系统,其基本工作流程包括三个关键环节:
(1)聚焦状态感知:获取当前图像或场景的清晰度信息,判别镜头相对于合焦位置的距离和方向。
(2)聚焦策略决策:基于感知到的聚焦状态,给出镜头运动的方向和步长。
(3)镜头执行控制:通过步进电机、音圈电机或压电驱动器等执行机构,驱动镜片组成像面发生相对位移。
上述三个环节相互耦合,共同决定了AF系统的综合性能。
1.3 AF算法的主要分类
根据聚焦信息的获取方式和处理策略的差异,自动聚焦技术可以从以下三个维度进行分类:
按信息获取方式分类:
- 主动式自动聚焦:通过发射红外、超声波或激光等信号并分析其反射来测量物距,进而调整焦点位置。该方法不依赖场景内容,在弱光或低对比度条件下具有优势,但需要额外的测距硬件。
- 被动式自动聚焦:仅依靠图像传感器采集的场景图像信息进行聚焦判断,包括对比度检测(Contrast Detection AF, CDAF)和相位检测(Phase Detection AF, PDAF)两大类。被动式方法无需额外发射装置,成本较低,在绝大多数消费类相机中占据主流。
按检测原理分类:
- 对比度检测法:通过分析图像的清晰度评价函数值随镜头位置的变化来搜索最佳对焦点。
- 相位检测法:通过分析不同视点(左/右光瞳)图像之间的相位差异来估计离焦量和方向。
- 深度测距法:通过激光雷达、结构光等手段直接测量目标距离。
按算法智能程度分类:
- 传统解析式方法:基于手工设计的清晰度评价函数和确定性搜索策略(爬山法、斐波那契搜索、曲线拟合等)。
- 机器学习方法:利用决策树、支持向量机等浅层模型辅助聚焦决策。
- 深度学习方法:采用卷积神经网络等方法端到端地预测离焦距离或最优焦点位置。
本报告后续章节将按照上述分类体系,结合技术演进的时间线,对各类AF算法进行详细介绍和系统比较。
第二章 主动式自动聚焦(Active Autofocus)
2.1 技术原理与历史背景
主动式自动聚焦是最早被商业化应用的AF技术。1977年,Konica C35 AF相机首次搭载主动式红外自动对焦系统,标志着AF技术进入实用化阶段。主动式AF的核心思想是:由相机主动发射测距信号(红外光、超声波或激光),通过测量信号往返时间或三角测量原理计算被摄物体的距离,再根据镜头的光学参数将镜头驱动至对应的合焦位置。
主动式AF的突出优点在于:不依赖场景内容,即使在弱光、低对比度或纯色表面上也能正常工作。但缺点也较为明显:测量范围有限(通常数米以内);对透明或高反射物体测量不准确;额外硬件增加了系统成本和体积。
2.2 红外测距法
红外测距法利用红外发光二极管(IRED)向目标发射调制红外光,由光电探测器接收反射信号,通过三角测量原理计算物距。该方法早期在胶片傻瓜相机中广泛应用,具有结构简单、成本低的优势,但有效测距范围通常小于5米,且受环境红外干扰影响较大。
2.3 超声波测距法
超声波AF利用压电换能器发射超声波脉冲,测量回波到达时间以计算距离。Polaroid公司在1978年推出的SX-70 Sonar相机是超声波AF的代表性产品。超声波法不受透明物体影响,但空间分辨率低,测距精度有限,已逐渐退出主流消费相机市场。
2.4 激光雷达(Lidar/dToF)测距法
近年来,基于飞行时间(Time-of-Flight, ToF)原理的激光测距技术在消费电子领域取得了突破性进展。直接飞行时间(dToF)传感器通过发射短脉冲激光并测量光子到达时间来计算距离。
2022年,意法半导体(STMicroelectronics)推出了全球首款集成超构透镜的dToF传感器VL53L8,有效测距范围提升至前代的2倍,功耗更低。2024年,荣耀Magic6系列手机首次搭载了1200点dToF激光雷达阵列对焦系统,支持60FPS对焦检测,结合400硬件相位对焦窗,实现了“激光对焦矩阵+相位对焦+对比度对焦”三位一体的对焦方案,扫描帧率提升400%,对焦精度提升18倍,对焦速度提升100%。
dToF技术的核心优势在于:(1)不受环境光影响,在极暗条件下仍可工作;(2)单帧即可获得场景深度图,为多目标对焦提供信息基础;(3)响应速度快,支持高帧率连续对焦。其局限在于:成本较高、多路径干扰影响精度、对器件工艺要求苛刻。
2.5 主动式AF的应用评估
应用场景:弱光/暗光环境下的对焦辅助;大光圈浅景深场景的初始位置估计;多目标场景的深度分层对焦;AR/VR应用中的空间感知。
综合评估:
- 对焦速度:★★★★★(本质上是“零搜索”方法,一次测距即可确定焦点位置)
- 对焦精度:★★★☆☆(受限于测距精度,通常需辅以被动式精细对焦)
- 硬件成本与资源消耗:★★☆☆☆(需额外传感器,成本较高)
- 开发难度:★★★☆☆(传感器标定、多传感器融合较为复杂)
典型应用代表:苹果iPhone Pro系列后置dToF Lidar、荣耀Magic6系列激光雷达对焦系统、ST VL53L系列dToF传感器。
第三章 被动式对比度检测自动聚焦(Contrast Detection AF)
3.1 技术原理与发展历史
对比度检测自动聚焦(CDAF)是应用最为广泛的被动式AF方法。其基本原理是:在图像对焦状态时,细节丰富、边缘锐利,对应的梯度值较高;而在离焦状态时,图像模糊,梯度值降低。CDAF通过计算图像的清晰度评价函数值随镜头位置的变化曲线,搜索评价函数的最大值来确定最佳对焦位置。
CDAF的经典实现分为两个核心组件:(1)清晰度评价函数,将图像映射为表征聚焦程度的标量值;(2)焦点搜索策略,在评价函数曲线上寻找全局最大值。
3.2 清晰度评价函数
清晰度评价函数是CDAF的核心,直接决定了聚焦的精度和可靠性。理想的清晰度评价函数应具备以下特性:单峰性(在合焦位置有唯一的全局最大值)、无偏性(最大值严格对应合焦位置)、高灵敏度(函数在峰值附近变化剧烈,有利于精确定位)、抗噪性和计算效率。
根据计算域的不同,清晰度评价函数可分为以下类别:
3.2.1 空域梯度类函数
空域梯度函数通过计算图像的空间导数来衡量清晰度,是工程应用中最常见的一类。
(1)Tenengrad函数:使用Sobel算子提取水平与垂直梯度幅值,将幅值平方和作为清晰度评价值。表达式为 F=∑x∑y[Gx(x,y)2+Gy(x,y)2]F = \sum_{x}\sum_{y} [G_x(x,y)^2 + G_y(x,y)^2]F=∑x∑y[Gx(x,y)2+Gy(x,y)2],灵敏度高但计算量偏大。
(2)平方梯度函数:直接计算相邻像素差值的平方和,表达式为 F=∑i=1M∑j=1N[y(i,j+1)−y(i,j)]2F = \sum_{i=1}^{M}\sum_{j=1}^{N} [y(i,j+1) - y(i,j)]^2F=∑i=1M∑j=1N[y(i,j+1)−y(i,j)]2,计算简单,适合资源受限的嵌入式平台。
(3)改进的拉普拉斯算子(SML/ML) :利用拉普拉斯算子的二阶导数特性进行清晰度评价。由于拉普拉斯算子基于二阶差分,对噪声敏感,研究者提出通过取绝对值或分窗口处理来改进其性能。
(4)Brenner梯度函数:仅计算相距2个像素的点的灰度差平方,计算速度极快。
(5)SUSAN清晰度评价函数:基于SUSAN边缘检测算子,将边缘点处USAN(同值收缩核面积)值的平方和作为清晰度评价值。实验表明,该函数对噪声不敏感,在TMS320C6416平台上的256×256图像处理仅需16ms。
3.2.2 频域变换类函数
频域函数通过傅里叶变换或离散余弦变换(DCT)将图像变换到频域,利用高频能量占比来衡量清晰度。聚焦图像的边缘和细节丰富,频域中高频分量能量大;离焦图像平滑度高,高频能量衰减。
(1)基于FFT的函数:计算二维傅里叶变换后的高频能量或频率加权和。
(2)基于DCT零系数的函数:利用DCT域中零系数数量随清晰度变化的关系。有研究者提出结合DCT零系数和局部标准差的聚焦评价算法,能够克服光照变化引起的函数曲线失真。
3.2.3 信息熵类函数
信息熵类函数基于图像灰度分布的统计特征。聚焦图像的灰度直方图分布更分散,信息熵较大。但此类函数对光照变化敏感,单峰性较差,实际使用相对较少。
3.2.4 统计学类函数
(1)方差/标准差函数:聚焦图像的标准差大于离焦图像。函数简单稳定,但变化不够灵敏。
(2)归一化自适应函数(NAVA) :NAVA函数通过归一化绝对值自适应处理,能够消除背景亮度变化和目标轮廓长度变化对清晰度评价的影响。与经典函数相比,NAVA的评价结果变异显著减小,与实际清晰度的相关性更弱地依赖于轮廓长度和背景亮度。
3.2.5 关键对比
一项系统性的比较研究对13种推广应用的清晰度评价函数进行了全面评估,总结出适合不同场景的最佳聚焦算法选择准则。一般而言,频域函数精度高但计算代价大,空域梯度函数在精度和效率间取得了较好平衡,在工程实践中应用最广。
3.3 焦点搜索策略
在选定清晰度评价函数后,搜索策略负责在评价函数曲线上高效找到最大值。良好的搜索策略应同时满足精度高、速度快、抗局部峰值干扰等要求。
3.3.1 全局搜索法
将镜头从最近端逐步移动到最远端,记录每一步的评价函数值,在遍历结束后选择最大值对应的位置。优势在于总能找到全局最大值,不受局部峰值干扰;劣势在于搜索步数多、耗时长、功耗大,难以满足实时性要求。该方法主要用于工业显微镜等对精度要求极高而对时间不敏感的场景。
3.3.2 爬山算法(Hill-Climbing Search)
爬山算法是最经典也是最广泛使用的CDAF搜索策略,核心思想类似于数值优化中的梯度上升法:初始阶段以大(粗)步长移动镜头,当评价函数值开始下降时,减小步长并反转方向,反复迭代直至达到预设精度要求。
爬山算法的主要问题在于:(1)对评价函数的单峰性要求高,局部峰值会导致错误聚焦;(2)峰值附近的振荡(“拉风箱”现象)增加了对焦时间;(3)弱光/低对比度场景下评价函数曲线平坦,难以判断方向。
众多改进方案被提出:
- 自适应步长爬山法:动态调整步长,初始大步快进,近峰小步精调,兼顾速度和精度。
- 带“动量”的爬山法:借鉴动量优化思想,减少峰值附近的反复振荡,提升稳定性。
- 分区搜索算法:根据聚焦评价函数值大小和曲线线形将评价曲线分为平缓区和陡峭区,平缓区使用自适应步长搜索提高速度,陡峭区使用两步搜索法避免假峰值干扰。实验表明,分区搜索算法相比传统爬山法聚焦速度提升11.25%。
3.3.3 斐波那契搜索与黄金分割搜索
基于序列消去法的搜索策略,利用斐波那契序列或黄金分割比(0.618)确定试探点位置,每次迭代缩小搜索区间。该方法基于评价函数单峰性的强假设,收敛速度较快,但当假设不成立时可能丢失真正的最大值。
3.3.4 曲线拟合法
在粗扫描获取少量评价函数值后,利用二次曲线或高斯曲线拟合评价函数曲线,通过解析求解拟合曲线的极值来预测最佳焦点位置。该方法能够显著减少需要的采样点数量,但对拟合模型的准确度和评价函数的形状有较高要求。
3.3.5 基于规则的搜索算法
该方法将搜索空间划分为初始区(Initial)、精细区(Fine)、中区(Mid)和粗区(Coarse)四个区域,根据当前所处的区域和评价函数值的变化趋势,应用一组启发式规则来动态决定镜头运动方向和步长。
研究表明,基于规则的搜索算法在DM310处理器上实现了实时处理(满足1秒时限要求),相较于全局搜索和二分搜索,对焦迭代次数和总步数均显著降低,功耗更低,且能够可靠找到全局峰值。在速度、准确率和功耗方面的综合性优于传统全局搜索和二分搜索方法。
3.3.6 各种搜索策略的性能对比
| 搜索策略 | 收敛速度 | 准确率 | 抗局部峰值 | 功耗 | 实时性 |
|---|---|---|---|---|---|
| 全局搜索 | 最慢 | 最高 | 最强 | 最高 | 差 |
| 爬山法 | 中等 | 较高(易受干扰) | 弱 | 中等 | 中等 |
| 自适应爬山法 | 较快 | 较高 | 中等 | 较低 | 较好 |
| 斐波那契/黄金分割搜索 | 快 | 中等(依赖单峰假设) | 弱 | 低 | 好 |
| 曲线拟合 | 快 | 中等(依赖模型) | 弱 | 低 | 好 |
| 基于规则的搜索 | 快 | 高 | 强 | 低 | 好 |
3.4 机器学习增强的对比度对焦
随着浅层机器学习方法的发展,研究者尝试将其应用于CDAF以提升性能。一项代表性工作利用监督机器学习构建爬山搜索的启发式策略:收集了32个典型摄影场景的基准数据集,采用决策树学习算法从数据中归纳启发式规则,并将其集成到控制算法中。实验表明,在常规场景下对焦准确率从91.5%提升至98.5%,在低光场景下从70.3%大幅提升至94.0%。该方法为解决对比度检测AF在弱光、多目标场景下的鲁棒性问题提供了新思路。
3.5 对比度检测AF的应用评估
应用优势:(1)仅需基础图像传感器,无需额外硬件,成本最低;(2)精度高,理论上可以找到最佳焦平面的位置;(3)实现灵活,可在软件层面升级优化。
应用局限:(1)速度慢,需要采集多帧图像进行比较,对焦过程中存在明显的“拉风箱”现象;(2)弱光、低对比度场景性能下降严重;(3)缺乏方向性信息,不知道需要向哪个方向移动镜头,只能通过试探来确定。
综合评估:
- 对焦速度:★★☆☆☆(需要多次采样和迭代搜索)
- 对焦精度:★★★★★(精细收敛后精度最高)
- 硬件成本与资源消耗:★★★★★(无需额外硬件,仅依赖主图像传感器)
- 开发难度:★★☆☆☆(算法成熟,资料丰富)
典型应用场景:低端手机和相机、监控摄像头、USB摄像头、工业相机、显微镜等成本敏感型场景。
第四章 相位检测自动聚焦(Phase Detection Autofocus)
4.1 技术原理与历史演变
相位检测自动聚焦(PDAF)是目前中高端相机和智能手机的主流AF方案。其原理来源于分像对焦和裂像测距的经典光学设计:通过特殊的光学结构将入射光线分为左、右两路,分别成像,测量两路图像之间的相位差(视差),根据相位差与离焦量之间的线性关系计算出所需的镜头位移量和运动方向。
相位检测自动聚焦经历了从独立AF模块(DSLR中的专用AF传感器)到图像传感器片上集成(片上PDAF)再到双像素(Dual-Pixel)方案的演进,体现了AF系统从分离硬件向高度集成化的发展趋势。
4.2 独立相位检测模块(DSLR时代)
在单反相机(DSLR)中,主反光镜将部分光线反射至独立的AF传感器模块,该模块包含分光棱镜和线性AF传感器阵列。通过分析左右光瞳图像的相关性来计算相位差,从而一次确定焦点位置和方向。
DSLR的独立PDAF系统速度快、精度高,但需要额外的光学元件和传感器,成本高、体积大,且需要精密校准以确保AF光路与成像光路的光程一致。佳能、尼康等品牌在DSLR时代积累了深厚的PDAF技术积淀。
4.3 片上相位检测(On-Sensor PDAF)
随着无反相机和智能手机的兴起,将相位检测像素嵌入图像传感器的“片上PDAF”成为主流方案。通过在部分像素上添加金属遮光罩,使该像素仅接收左半光瞳或右半光瞳的光线,形成相位检测像素对。芯片上成千上万个这样的像素对构成了相位检测阵列。
遮罩式PDAF像素的代价是遮光金属层会减少到达像素的光线量,对于密集排布情况,被遮蔽的像素不能作为正常成像像素使用,需要通过相邻像素插值补偿,可能引入图像质量劣化。因此,PDAF像素通常按照稀疏的重复模式排布。
4.4 双像素(Dual-Pixel)技术
双像素技术是片上PDAF的进阶方案:单个微透镜下放置两个独立的光电二极管(分别标记为左像素和右像素),每个微透镜下的两个光电二极管构成一个相位检测单元。由于每个像素都参与相位检测,PDAF密度极高;同时左右两个子像素信号合并后即为完整像素信号,不影响正常成像质量。
双像素PDAF的成功应用同样面临技术挑战:双光电二极管的垂直钉扎电压模型需精确设计,以确保左右像素的对称性和线性响应特性。
4.5 多平面相位检测
针对三芯片8K彩色成像相机等高端广播级设备,研究者提出了多平面PD AF方法。该方法利用半遮蔽PD像素与对应同一入射位置的其他正常像素之间的视差来计算聚焦状态,能够实现精确的自动聚焦且无需采用最先进的双光电二极管技术。通过在原型8K PD传感器上将PD像素安装在蓝色通道中,实现了优异的相位分离比和稳健的视差计算。
4.6 相位差图像处理方法
除了硬件层面的PDAF方案,基于纯图像处理的相位差方法也在发展。浙江大学2024年提出的多目标自适应聚焦算法基于图像相位差,通过多尺度图像匹配提高相位差计算精度,并自适应调整离焦估计模型。该算法通过对多目标区域按离焦估计排序来减少总体对焦时间,将离焦估计与图像清晰度相结合实现各区域的精确聚焦。实验结果表明该方法无需依赖镜头标定,在多目标场景下的对焦速度明显优于传统算法。
4.7 相位检测AF的应用评估
应用优势:(1)速度快,一次拍照即可计算离焦方向和量;(2)支持连续对焦和运动追踪;(3)双像素方案不影响成像质量。
应用局限:(1)需要特制传感器硬件;(2)片上PDAF像素可能引入成像伪影;(3)弱光条件下相位信号信噪比下降;(4)受限于传感器制造工艺,成本高于纯CDAF方案。
综合评估:
- 对焦速度:★★★★★(单次/数次采样即确定方向和距离)
- 对焦精度:★★★★☆(精度较高,但终极精度仍需辅以CDAF微调)
- 硬件成本与资源消耗:★★★☆☆(需要PDAF传感器,增加芯片成本)
- 开发难度:★★★★☆(涉及传感器像素设计、相位计算算法、校准流程)
典型应用场景:中高端智能手机、无反相机、DSLR相机、高端安防摄像机等速度敏感型场景。
第五章 基于深度学习的自动聚焦
传统AF算法虽然在多数场景下能够正常工作,但在复杂场景(弱光、低对比度、多目标、运动场景)中仍面临速度与精度的挑战。深度学习技术的兴起为AF领域带来了革命性的变化。
5.1 深度学习用于AF的动机与技术路线
传统对比度最大化方法的两大核心——评价度量和搜索策略——均依赖于工设计,存在固有局限:评价度量本身不直接提供焦点状态信息,需要进行大量比较;每次搜索的位移量无法由单帧图像确定,需要多次采样。深度学习方法的引入可以直接从图像中学习聚焦特征,实现从“多步搜索”到“少步预测”的跨越。
已有研究证明,深度学习方法可以从1-2张图像确定最佳聚焦位置,使对焦速度达到传统搜索方法的5-10倍。与相位检测方法不同,深度自聚焦不需要特殊硬件;与传统方法相比,AI方法可以生成基于场景的聚焦轨迹,优化动态三维场景的合成图像质量。
目前基于深度学习的AF方法主要分为以下技术路线:
5.1.1 基于分类的方法
将AF构建为聚焦/离焦分类或多级焦点位置分类问题,通过CNN对图像或图像块进行分类。
5.1.2 基于回归的方法
直接从单帧或少数几帧图像回归预测离焦距离或镜头所需的位移量(一步对焦)。
5.1.3 基于强化学习的方法
将AF建模为序贯决策过程(马尔可夫决策过程),通过深度强化学习训练智能体学习最优的镜头运动策略。
5.1.4 基于事件相机的方法
利用事件相机的高时间分辨率特性,结合深度学习或手工特征实现高速对焦。
5.2 关键方法与代表性工作
5.2.1 FDNet:轻量级焦点辨别网络
FDNet(Focus Discriminative Network)是2025年发表于《Neural Processing Letters》的轻量级AF网络。该网络以ShuffleNet V2为骨干,利用遗传算法优化(GAO)策略自动搜索高效的网络结构,并引入坐标注意力(CA)和多尺度特征融合(MFF)模块增强空间、方向和上下文特征提取能力。
FDNet将AF构建为图像焦点的多级分类任务,研究人员专门构建了高质量的聚焦堆栈数据集用于训练和评估。实验结果表明,FDNet在分类准确率上超过主流方法高达4%,同时仅需0.2 GFLOPs计算量、0.5M参数量、2.1MB模型大小和0.06秒推理时间,在性能和效率之间取得了优异的平衡。
5.2.2 序数回归方法与MobileViT方案
中科院长春光机所团队提出了基于深度学习的动态ROI自动聚焦方法。该工作首先构建了灰度图像自动聚焦数据集,将自动聚焦问题转化为序数回归任务,并提出两种聚焦策略:全栈搜索和单帧预测。核心网络采用MobileViT架构,利用线性自注意力机制实现对动态感兴趣区域的聚焦。
实验显示,全栈搜索策略的聚焦MAE(平均绝对误差)低至0.094,聚焦时间27.8ms;单帧预测策略的MAE为0.142,聚焦时间27.5ms。该方法验证了轻量级ViT架构在AF任务上的高效性。
5.2.3 深度强化学习方法
香港理工大学和浙江大学团队提出了一种基于深度强化学习(DRL)的相机AF框架,核心创新包括:
- 将AF建模为多步序贯决策过程,镜头运动轨迹由DRL策略动态生成。
- 采用预训练的MobileNet-v2编码器进行图像特征提取,DRL策略基于这些特征高效接近合焦位置。
- 设计高斯过程回归(GPR)模块,利用DRL生成的镜头位置轨迹上的清晰度度量值来预测合焦位置并终止探索过程。
该方法利用多步探索带来的序贯信息,获得了比一步预测方法更高的预测精度。实验表明在速度和精度方面均显著优于搜索式和预测式基线方法。
5.2.4 专家轨迹正则化的DRL方法
2025年CVPR接收的“Stabilizing and Accelerating Autofocus with Expert Trajectory Regularized DRL”在此前DRL方案的基础上,进一步引入专家轨迹正则化技术。通过利用镜头运动轨迹的序贯信息,同时增强多步合焦预测精度并减少“焦点搜寻”现象的发生概率。
5.2.5 DeepAf:单次空谱联合自动聚焦
DeepAf是2025年发表于MICCAI的单次自动聚焦框架,专为数字病理学设计。其核心创新在于融合空间特征和频域特征(通过混合架构),实现从单帧图像直接回归预测到最佳焦点的距离。
在相同实验室样本上,DeepAf实现了0.18μm的聚焦精度,仅需双图方法一半的输入即可匹配其0.19μm的性能;在跨实验室泛化测试中,仅有0.72%的误聚焦预测,90%的预测落在景深范围内。与堆栈式方法相比,DeepAf将对焦时间缩短了80%。
5.2.6 不确定性建模的贝叶斯CNN方法
在显微成像中,传统CNN模型对分布外的样本类型可能产生不可靠的预测。2025年发表于《Journal of Lightwave Technology》的研究引入了贝叶斯卷积神经网络,用于从单帧图像预测离焦距离,同时生成预测的不确定性估计。
利用不确定性估计,该方法能够动态评估和筛选焦点预测的可靠性,在多样化的样本类型(病理组织切片、PCB检测等)上确保鲁棒的性能。基于不确定性框架,研究者还提出了创新的焦平面对齐策略,进一步提升了系统在复杂成像环境中的适用性。
5.2.7 空间变化自动聚焦
卡内基梅隆大学(CMU)在ICCV 2025上提出的空间变化自动聚焦系统是一项突破性工作。传统相机仅能对单一深度平面聚焦,景深范围有限。SVAF系统通过结合Lohmann透镜和相位型空间光调制器(SLM)的可编程光学器件,使每个像素能够独立对不同深度聚焦,实现了全场景同时清晰成像——即自由形状的景深。
该工作的算法核心在于将经典自聚焦技术扩展到空间变化场景,利用对比度和视差线索迭代估计深度图,使相机能够逐步将景深形状调整至适应场景深度分布。
5.2.8 事件驱动的单步高速自聚焦
2025年CVPR发表的“One-Step Event-Driven High-Speed Autofocus”论文提出了首个单步事件驱动自聚焦方法。该工作引入事件拉普拉斯乘积(Event Laplacian Product, ELP)焦点检测函数,将事件数据与灰度拉普拉斯信息融合,将对焦搜索重新定义为检测任务。
通过在DAVIS346和EVK4数据集上的验证,该方法将对焦时间缩短了最多三分之二,对焦误差分别降低24倍(DAVIS346)和22倍(EVK4)。研究还针对仅有事件相机的场景设计了完整的自聚焦流水线,在具有挑战性的运动和光照条件下均取得了准确结果。
事件相机检测每个像素的亮度变化而非等间隔采样完整帧,具有微秒级时间分辨率和极高动态范围,天然适合高速对焦场景。此前的事件驱动方法仍需要采集完整的聚焦堆栈来搜索合焦位置,本质上还是“多次采样+搜索”范式。ELP函数通过联合事件流和灰度图像的拉普拉斯信息,将焦点状态编码为可检测的特征,真正实现了“一步对焦”。
5.3 深度学习方法的应用评估
应用优势:
- 对焦速度快,单帧预测方案可跳过传统迭代搜索过程;
- 场景自适应能力强,不依赖手工设计的评价函数;
- 可用于解决传统方法难以处理的特殊场景(小景深、弱光、稀疏内容);
- 潜力巨大,可与计算摄影深度融合(如全聚焦成像)。
应用局限:
- 对训练数据质量和数量要求高,标注成本大;
- 存在域偏移问题:训练环境和真实部署环境的差异影响泛化性能;
- 对算力要求较高,在资源受限的嵌入式平台上部署挑战大;
- 可解释性弱,“黑箱”特性使其在安全关键应用中受限。
综合评估(以2025年前沿水平为参考):
- 对焦速度:★★★★☆(单帧/少帧对焦潜力极大,但推理延迟仍是瓶颈)
- 对焦精度:★★★★☆(部分方法已超过传统方案,但泛化仍有挑战)
- 硬件成本与资源消耗:★★☆☆☆(需要GPU/NPU等AI加速器,功耗较高)
- 开发难度:★★★★★(需要大量数据和深度学习专业知识)
第六章 混合对焦及其他新兴方案
6.1 混合对焦系统
将多种AF技术组合使用以互补优势是现代成像系统的主流思路。目前中高端智能手机普遍采用“PDAF + CDAF + 激光辅助”的三位一体混合对焦方案。
混合对焦的典型工作流程是:
- 第一阶段(粗定位) :PDAF检测离焦方向和粗略量,dToF激光雷达在弱光场景下提供测距辅助;镜头以大/中步长快速移向合焦位置。
- 第二阶段(精调) :CDAF以小步长精细扫描合焦位置附近区域,通过清晰度评价函数找到精确焦点。
- 第三阶段(持续跟踪) :对运动目标,PDAF持续检测离焦变化,结合预测算法(卡尔曼滤波或深度模型)提前调整焦点。
混合对焦系统有效克服了单一方法的缺陷:PDAF解决了CDAF缺乏方向性导致搜索慢的问题,CDAF弥补了PDAF终极精度有限的不足,激光辅助则在低照度和低纹理场景下提供可靠的“兜底”方案。
6.2 传感器内处理自动聚焦
传感器内视觉处理器(In-situ Vision Processor, IVP)代表了图像处理的范式转变——在传感器层面直接进行实时处理,无需将原始数据传输到外部处理器。这项技术能显著降低延迟、功耗和数据带宽需求,在机器人、自动驾驶和神经形态视觉系统等嵌入式场景具有巨大潜力。
研究者提出了一种仿生自聚焦系统,通过IVP和液体透镜实现自适应、节能对焦。系统集成了并行传感器内清晰度测量、目标运动检测和黄金攀登搜索(Golden Climbing Search, GCS)算法来优化焦距。清晰度评估、帧差目标定位和焦距调节均在传感器上直接完成,在动态环境中实现了快速高效的AF。
在液体透镜振荡期间的传感器内计算自聚焦方案也被提出,该方法引入传感器内并行清晰度测量,在液体透镜的振荡阶段直接在传感器上采集聚焦图像,无需等待透镜稳定后再成像。
6.3 基于事件相机的稳健自聚焦
除前文介绍的ELP单步方法外,事件相机自聚焦领域还有以下代表性工作:
- 事件黄金搜索(EGS)方法:提出事件速率作为聚焦度量函数,配合事件黄金分割搜索策略,在极端光照和运动场景下实现稳健对焦。
- 极性自聚焦(PBF)方法:基于事件极性率与焦点位置之间的相关性,提出通用的事件相机自聚焦算法,适用于大多数事件相机设备。
- 粗到细的显微对焦方法:为基于事件相机的显微成像提出了完全自动化的由粗到细对焦方法,不依赖于物镜与样本之间的初始距离。
6.4 液体透镜自聚焦
液体透镜通过电压控制改变液-液或液-固界面的曲率,实现焦距的动态调节。由于没有机械运动部件,液体透镜具有响应快(毫秒级)、体积小、寿命长的优势。
基于图像反馈的液体透镜自动对焦方案通过分析二进制目标的边缘斜率宽度作为聚焦度量参数,利用PID控制或规则策略调整透镜电压。该方案在机器视觉、工业检测等场景展现出良好的应用前景。基于帧抓取器FPGA的图像式自聚焦方案使用液体透镜作为前端光学元件,通过FPGA硬件加速实现实时对焦,实现了软硬件协同优化。
6.5 并行计算加速
随着多核CPU和GPU性能的大幅提升,通过并行化处理加速传统清晰度评价函数计算成为一个实用方向。2025年的研究表明,相比传统的串行AF处理方法,GPU并行化的平均加速比常常超过5.53倍,最大加速比达到27.90倍,在不同计算平台上均显著提升了处理速度,带来了时间效率和能效的双重收益。
第七章 算法多维度对比与应用评估
7.1 综合性评估指标
对自动聚焦算法的全面评估需要从多维度综合考量。已有研究系统提出了四项AF性能指标来同时衡量系统的所有关键方面:对焦速度、对焦精度、功耗和用户体验。本报告在此基础上扩展为六维评估体系:
(1)对焦速度:从触发对焦到完成对焦的总时间(ms),包括图像采集时间、算法计算时间和镜头驱动时间。
(2)对焦精度:最终焦平面位置与理想合焦位置之间的偏差(μm或步数)及一致性(重复精度)。
(3)硬件依赖:是否需要额外硬件支持(PDAF传感器、激光测距模组、NPU等)。
(4)资源消耗:算法运行所占用的计算资源(CPU负载、内存占用、功耗)。
(5)开发难度:算法复杂度、调试难度、标定需求及工程化门槛。
(6)场景鲁棒性:在不同光照条件、纹理复杂度、运动状态下的性能稳定性。
7.2 各大类算法多维对比
| 评估维度 | 主动式AF(dToF) | 对比度检测AF | 相位检测AF | 深度学习AF | 混合对焦 |
|---|---|---|---|---|---|
| 对焦速度 | ★★★★★(零搜索) | ★★☆☆☆(多步迭代) | ★★★★★(单次/少次) | ★★★★☆(推理有延迟) | ★★★★★ |
| 对焦精度 | ★★★☆☆(辅以CDAF) | ★★★★★ | ★★★★☆ | ★★★★☆ | ★★★★★ |
| 硬件依赖 | ★★☆☆☆(需额外传感器) | ★★★★★(仅需主传感器) | ★★★☆☆(需PDAF传感器) | ★★☆☆☆(需AI加速器) | ★★☆☆☆(多传感器) |
| 资源消耗 | ★★★★☆(功耗低) | ★★★☆☆(CPU计算) | ★★★★☆(计算量小) | ★★☆☆☆(推理功耗高) | ★★★☆☆ |
| 开发难度 | ★★★☆☆(标定复杂) | ★★☆☆☆(算法成熟) | ★★★★☆(传感器级开发) | ★★★★★(数据+训练) | ★★★★☆(多系统融合) |
| 弱光鲁棒性 | ★★★★★ | ★★☆☆☆ | ★★★☆☆ | ★★★☆☆(依赖训练) | ★★★★★ |
| 运动追踪 | ★★★★☆ | ★☆☆☆☆ | ★★★★★ | ★★★★☆ | ★★★★★ |
7.3 不同应用场景的模式推荐
根据以上分析,可以总结出不同的推荐方案:
(1)高端智能手机(旗舰影像)
- 推荐模式:PDAF + 激光辅助 + CDAF精调的三位一体混合方案
- 代表实现:三星/苹果旗舰、荣耀Magic6系列1200点dToF系统
- 关键指标:60FPS连续对焦检测,低至亚毫米级对焦精度
(2)中低端手机与消费类相机
- 推荐模式:片上PDAF + 简化CDAF的混合方案(或纯CDAF + AI辅助)
- 优势:成本可控,性能均衡
(3)工业相机与机器视觉
- 推荐模式:液体透镜 + FPGA加速CDAF(或GS搜索+阴影校正)
- 代表实现:Basler图像式AF方案(液体透镜+FPGA帧抓取器)
- 优势:无机械疲劳,长期稳定性好
(4)显微镜与数字病理
- 推荐模式:深度学习单帧预测(如DeepAf)或粗到细CDAF搜索
- 代表实现:DeepAf(单帧80%加速比),不确定性辅助贝叶斯CNN
- 优势:适应稀疏内容和组织形态变化
(5)自动驾驶与安防监控
- 推荐模式:事件相机+PDAF+深度学习预测的多传感器融合方案
- 优势:高动态范围、微秒级时间分辨率、全天候工作
(6)科学成像与研究
- 推荐模式:SVAF空间变化自聚焦(自由形景深)或CDAF精确对焦
- 优势:全场景同时清晰,突破传统景深限制
7.4 典型算法的资源消耗定量对比
| 算法/方法 | 参数量 | FLOPs | 模型大小 | 单次推理时间 | 聚焦总时间 | 硬件平台 |
|---|---|---|---|---|---|---|
| 传统CDAF(爬山法) | — | — | — | — | 200-1000ms | 嵌入式CPU |
| FDNet | 0.5M | 0.2G | 2.1MB | 60ms | ~100ms | 移动端GPU |
| MobileViT AF | ~5M | — | — | 27.5ms | 27.5-27.8ms | GPU |
| DeepAf | — | — | — | 单帧 | 较堆栈法-80% | GPU |
| ELP(事件相机) | — | — | — | — | 较传统-66% | 事件相机+CPU |
| 基于规则的搜索 | — | — | — | — | <1000ms | DM310 DSP |
数据来源:
第八章 技术挑战与未来趋势
8.1 当前面临的主要技术挑战
(1)极限场景下的鲁棒性:
弱光、背光、低纹理和高速运动场景仍然是自动聚焦技术的“硬骨头”。传统CDAF在低对比度下方向判断困难,PDAF在极暗光下相位信号微弱,深度学习方法对分布外场景的泛化能力有待提升。
(2)精度与速度的矛盾:
CDAF精度最高但速度慢,PDAF和深度学习方法速度快但终极精度仍未超越CDAF。如何在不牺牲精度的前提下大幅提升速度,或如何在保持速度的同时提升精度,是AF算法的核心矛盾。
(3)多目标场景的智能决策:
当画面中存在多个不同深度的目标时,系统需要智能地判断焦点优先级。传统方案依赖用户手动选择对焦点,固定中心窗口方案则缺乏场景理解能力。深度学习方法虽能动态选择ROI,但在复杂语义理解方面仍有欠缺。
(4)实时性与功耗的平衡:
尤指在移动设备上,深度学习AF模型的推理延迟和功耗是工程落地的关键制约因素。模型压缩、量化、蒸馏等技术虽能缓解这一矛盾,但往往伴随着精度损失。
(5)数据集匮乏问题:
深度学习AF方法的性能高度依赖大规模、高质量、多样化标注数据集。目前此类数据集相对匮乏,标注成本高昂,且不同成像系统(手机相机、显微镜、工业相机)之间的迁移性有限。
8.2 未来发展趋势
(1)端到端智能自聚焦:
将深度学习模型直接部署在图像信号处理器(ISP)或传感器内部,实现端到端的智能对焦。未来可能不再需要独立的PDAF像素或CDAF搜索策略,单个轻量级CNN直接从RAW图像预测最佳焦点位置,减少系统级复杂度和延迟。
(2)传感器-算法协同设计:
传感器内处理(In-Sensor Computing)将彻底改变传统的传感器-处理器分离架构。通过像素级并行计算,清晰度评估可在读出阶段完成,结合仿生视觉机制实现亚毫秒级聚焦响应。IVP技术与事件相机的结合将催生新一代超高速自聚焦系统。
(3)计算摄影与全聚焦成像:
CMU的空间变化自聚焦系统的成功论证了计算自聚焦的巨大潜力。未来相机有望突破传统的平面景深限制,通过计算光学元件实现像素级独立对焦,在单帧内完成全场景无模糊成像。
(4)事件相机与帧相机融合:
事件相机凭借微秒级时间分辨率、高动态范围(>120dB)和低数据冗余,天然适合高速对焦场景。随着事件相机传感器成本的下降和微型化,事件+RGB的融合AF将成为高速运动场景和低照度场景的标配方案。ELP函数等创新工作已证明“一步对焦”在事件域中是可行的。
(5)神经渲染与景深扩展:
将神经渲染技术(NeRF、3D Gaussian Splatting)融入自聚焦系统,通过少帧图像重建三维场景的连续焦平面表示,实现“先拍摄、后对焦”的计算摄影范式。这将从根本上改变对焦问题的现有求解框架——从物理对焦转向计算合成。
(6)AI ISP芯片一体化:
随着AI ISP芯片的日益成熟(如高通Spectra ISP、自研影像芯片),深度学习AF模型将以硬件固化的形式集成到ISP流水线中,实现零延迟的AI对焦。未来ISP将同时运行去噪、超分、HDR、AI-AF等一系列深度学习模型,打造“软件定义相机”的全新架构。
第九章 总结
本报告对成像系统自动聚焦算法进行了全面的技术调研、分类梳理与多维度评估。主要结论如下:
第一,AF算法经历了从主动到被动、从硬件依赖到纯图像处理、从手工设计到数据驱动的清晰演进路径。 从1970年代的主动红外测距和超声波对焦,到1980-2000年代以爬山法和CDAF为核心的被动对焦,再到2010年代片上PDAF和双像素技术的全面普及,最后到2020年代深度学习方法的蓬勃兴起。
第二,目前行业主流方案为“混合对焦”——PDAF确定方向与粗略距离、激光辅助弱光场景、CDAF完成精细收敛。 多传感器融合充分发挥了各类技术的互补优势,在速度、精度和场景鲁棒性之间达成了最优平衡。
第三,深度学习方法在单帧/少帧对焦和场景自适应方面展现出突破性潜力。 从早期决策树辅助CDAF(2015年),到基于CNN/MobileNet的焦点分类与回归方法(2020-2024年),再到深度强化学习和贝叶斯不确定性建模(2025年),深度学习AF已经实现了对传统搜索式方法5-10倍的速度提升,并能够在显微镜病理、高速运动等特殊场景中取得优异性能。
第四,新兴硬件技术正在重塑AF系统的底层架构。 事件相机、液体透镜、传感器内处理(IVP)、可编程光学器件(SLM)等硬件创新为AF算法提供了全新的信息维度和计算能力,使“一步对焦”、“全场景同时清晰”等此前难以实现的功能成为可能。
第五,深度学习AF的大规模工程化落地仍面临挑战。 轻量级网络设计(如FDNet的0.2 GFLOPs)和硬件推理加速正在缩小理论与应用之间的鸿沟。未来AI ISP芯片集成和传感器-算法协同设计将进一步降低部署门槛,推动智能化自聚焦走向全面实用化。
参考文献
[1] Wang C, Huang Q, Cheng M, et al. Intelligent Autofocus. arXiv:2002.12389, 2020.
[2] FDNet: A Novel Image Focus Discriminative Network for Enhancing Camera Autofocus. Neural Processing Letters, Vol. 57, Article 76, 2025.
[3] Wang Y, et al. Deep Learning-Based Dynamic Region of Interest Autofocus Method for Grayscale Image. Sensors, 24(13):4336, 2024.
[4] Yeganeh Y, et al. DeepAf: One-Shot Spatiospectral Auto-Focus Model for Digital Pathology. MICCAI 2025, arXiv:2510.05315, 2025.
[5] Deep Reinforcement Learning-Based Camera Autofocus with Gaussian Process Regression. IEEE ICPR 2024, Tokyo, Japan, 2025.
[6] Bao Y, Gao S, Li W, Wang K. One-Step Event-Driven High-Speed Autofocus. CVPR 2025, pp. 6222-6230, 2025.
[7] Stabilizing and Accelerating Autofocus with Expert Trajectory Regularized Deep Reinforcement Learning. CVPR 2025, 2025.
[8] Spatially-Varying Autofocus. ICCV 2025, CMU, 2025.
[9] Modeling Uncertainty in Deep Learning for Focus Prediction of Defocused Images. Journal of Lightwave Technology, 43(15):7219-7232, 2025.
[10] Zhang W. The Historical Revolution and Progress of Camera Auto Focus Systems. Highlights in Science, Engineering and Technology, 2024.
[11] Multi-Target Adaptive Focusing Algorithm Based on Image Phase Difference. Electronics, 13(24):4917, 2024.
[12] Multi-Plane Phase Detection Autofocus for 8K Three-Chip Color Imaging Cameras. IEEE GCCE 2020, Kobe, Japan, 2020.
[13] Mir H, Xu P, van Beek P. Improving the accuracy and low-light performance of contrast-based autofocus using supervised machine learning. Pattern Recognition Letters, 56:30-37, 2015.
[14] NAVA Evaluation Function of Image Clarity. Sensors, 23(22):9017, 2023.
[15] 李全勇 等. 基于数字图像处理的自动对焦算法的比较与分析. 电脑知识与技术, (35):8060-8077, 2013.
[16] Development and real-time implementation of a rule-based auto-focus algorithm. Real-Time Imaging, 2003.
[17] Performance metrics for auto-focus in digital and cell-phone cameras. IEEE, 2008.
[18] A bio-inspired in-sensor measurement system for dynamic focus tracking and control. Measurement, 267:120459, 2026.
[19] In-Sensor Computing for Rapid Image Focusing during Liquid Lens Oscillation. 2025.
[20] Image-based autofocus solution with algorithms on frame grabber FPGA. Basler AG, 2023.
[21] Generalized Parallel Implementations of Intuitive Digital Focus Indices with Cross-Platform Compatibility. ITIIS, 2025.
[22] STMicroelectronics. VL53L8 direct Time-of-Flight sensor, 2022.
[23] US Patent 9,804,357. Phase detection autofocus using masked and unmasked photodiodes. 2017.
[24] Ahn H S, et al. Pinning voltage model of vertical pinned photodiode for Dual-Pixel image sensor. Solid State Electronics, 2024.
[25] 基于SUSAN算子的清晰度评价函数在自动对焦中的应用. 光学学报, 2014.
[26] 基于DCT零系数和局部标准差的自动聚焦算法. 光学技术, 2018.
[27] 结合自适应步长和两步搜索法的分区搜索自动聚焦算法. 激光与光电子学进展, 2024.
[28] Basler AG. Image-based autofocus solution with algorithms on frame grabber FPGA. 2023.
更多推荐



所有评论(0)