[ICCV 2025]多模态大模型解决底层视觉任务

题目:Perceive, Understand and Restore: Real-World Image Super-Resolution with Autoregressive Multimodal Generative Models
论文地址:https://arxiv.org/pdf/2503.11073

创新点
-
本文首次提出利用预训练的自回归多模态模型(如Lumina-mGPT)构建强大的Real-ISR模型(PURE),通过感知和理解低质量输入图像的内容,实现高质量图像的重建。这一创新突破了传统基于扩散模型的方法在复杂场景下的局限性,为Real-ISR任务提供了新的解决方案。
-
PURE模型通过指令微调机制,实现了对低质量图像的顺序处理:首先感知图像的退化程度(如噪声和模糊水平),然后理解图像内容并生成语义描述,最后基于这些信息逐步生成高质量图像。这种分阶段处理方式增强了模型对复杂场景的全局理解和局部细节恢复能力。
方法
本文主要研究方法是提出了一种基于自回归多模态生成模型的实时真实世界图像超分辨率(Real-ISR)框架——PURE。该框架通过指令微调预训练的自回归多模态模型(Lumina-mGPT),使其能够感知低质量图像的退化程度、理解图像内容并生成语义描述,进而基于这些信息逐步生成高质量图像。具体而言,PURE模型采用分阶段处理机制:首先利用退化估计模块(DEM)量化分析输入图像的噪声和模糊水平;随后通过LLaVa模型生成结构化语义描述,建立文本与视觉内容的关联;最终通过自回归生成过程,结合退化信息、语义上下文和序列结构一致性,逐步生成高质量图像令牌。为优化局部结构生成,模型引入了基于熵的动态Top-k采样策略,根据生成过程中各令牌的熵值自适应调整采样空间大小,从而在保持全局语义一致性的同时生成更真实的细节。
有基于扩散模型的真实图像超分辨率方法的局限性示意图

本图通过对比当前领先的基于稳定扩散模型(SD)的真实图像超分辨率方法(如SeeSR和OSEDiff)的重建结果,直观揭示了其在处理复杂场景时存在的两大核心缺陷。图1a展示了语义内容错误恢复的典型案例:当输入图像包含建筑物和悬崖的混合场景时,SeeSR和OSEDiff由于缺乏对图像内容的全局理解能力,错误地将建筑物识别为悬崖,导致场景语义完全失真。b则揭示了局部结构不自然的恢复问题:在生成狮子图像时,这些方法未能准确建模自然图像中局部结构的空间关系,导致舌头与毛发的过渡区域出现违背物理规律的异常纹理(如将舌头表面错误生成为带毛发的结构)。这些实例表明,现有基于扩散模型的方法虽然能生成视觉上较为平滑的结果,但在处理包含多物体或严重退化的复杂场景时,由于缺乏对图像内容的深度感知和局部结构关系的精确建模,容易产生语义错误和物理上不合理的重建结果。本研究提出的PURE框架通过引入自回归多模态生成模型,有效解决了这些局限性。
PURE框架基于自回归多模态生成模型的图像超分辨率处理流程图

本图展示了PURE框架的核心处理流程,其创新性地通过指令微调预训练的自回归多模态模型(Lumina-mGPT)实现图像感知、理解与恢复的协同处理。输入的低质量图像首先经过视觉令牌器(VQGAN)转换为离散图像令牌,同时指令文本“感知退化程度、理解图像内容并恢复高质量图像”通过文本令牌器处理为文本令牌序列。这些令牌被输入至仅解码器的Transformer骨干网络,依次执行三个阶段的任务:在感知阶段,模型通过退化估计模块(DEM)量化图像的噪声和模糊水平,生成离散的退化标签;在理解阶段,模型基于地面真实图像生成的语义描述进行监督训练,提取图像的上下文语义信息;在恢复阶段,模型结合退化特征、语义上下文和序列结构一致性,通过自回归生成机制逐步预测高质量图像令牌。最终,这些令牌经视觉解码器重建为超分辨率图像。图中特别标注了动态Top-k采样策略的应用:根据当前生成令牌的熵值自适应调整采样空间大小,在边缘等结构明确区域采用小k值(如k=1)保持结构,在纹理丰富区域采用大k值(如k=2000)增强细节。这一流程通过统一的多模态建模框架,有效解决了传统方法在复杂场景下语义错误和局部结构不自然的问题。
图像令牌熵值与生成结构关系的可视化分析图

本图通过热力图形式直观展示了图像生成过程中各令牌的熵值分布与其对应空间结构的关系。图中左侧为生成图像的熵值热力图,其中深色区域代表高熵值令牌,浅色区域代表低熵值令牌;右侧为对应的生成图像,标注了不同结构特征(如边缘、纹理)的分布。实验发现,高熵值令牌通常集中在具有复杂纹理或多物体交叠的区域(如动物毛发、草地),这些区域需要更丰富的细节生成;而低熵值令牌主要出现在边缘或平滑区域(如物体轮廓、天空),这些区域的结构一致性要求更高。
实验

本表全面比较了PURE模型与当前主流扩散型真实图像超分辨率方法(StableSR、DiffBIR、SeeSR、PASD、OSEDiff)在四个测试数据集(OST-Val、RealSR、DrealSR、RealLQ250)上的性能表现,涵盖参考型指标(PSNR、SSIM)、感知型指标(LPIPS、DISTS、FID)和无参考型指标(NIQE、MUSIQ、MANIQA、CLIPIQA、TOPIQ)。实验结果显示,尽管PURE在PSNR和SSIM等参考型指标上略低于部分扩散方法(如PASD在RealSR数据集上PSNR高3.8dB),但在无参考型指标上表现出显著优势:例如在RealSR数据集上,PURE的NIQE值(5.4090)比次优方法低0.4833,MUSIQ值(72.37)比次优方法高0.77,表明其生成结果在自然度和结构完整性上更接近真实图像。特别是在DrealSR数据集的2倍超分辨率任务中,PURE的FID值(79.41)比次优方法低17.25,证明其在多物体复杂场景下能生成更符合统计分布的高质量图像。用户研究进一步验证了PURE的主观优势,其选择率(38.9%)显著高于扩散型方法(最高17.9%),表明其恢复结果在内容一致性和视觉真实性上更受认可。这些结果证明,PURE通过自回归多模态建模框架,有效解决了传统扩散方法在语义理解和局部结构建模上的局限性,在真实复杂场景中展现出更强的泛化能力和感知质量。
--END--
最后对AI大模型感兴趣的可关注公众号后台私信‘977C’或者扫描下方👇二维码进入大模型交流群!
更多推荐


所有评论(0)