【ICLR26匿名投稿】LENS 让多模态大模型拥有“像素级视力”
文章:Segmentation as a Plug-and-Play Capability for Frozen Multimodal LLMs
代码:暂无
单位:暂无
一、问题背景:分割任务与多模态模型的融合困境
近年来,多模态大语言模型(Multimodal Large Language Models, MLLMs)如 GPT-4V、Qwen2.5-VL、LLaVA 等快速崛起, 使 AI 具备了“看图说话”“跨模态推理”等能力。 然而,让 MLLM 理解到像素级别的细节(Segmentation) 仍然是一个长期难题。
分割任务需要模型具备精确的空间理解,而 MLLM 的输出通常是语言形式。
如何在不重新训练模型的前提下,让它具备像素级感知能力?
目前主流方法存在三大问题:
-
⚙️ 需要微调(Finetuning) —— 改动模型结构,破坏泛化性;
-
💾 改变输出空间(Output Space) —— 语言与掩码空间不兼容;
-
🧩 高训练成本 —— 每次新任务都需重新适配与训练。
为了解决这些痛点,作者提出了一种新的分割范式:
LENS (Leveraging kEypoiNts for MLLMs’ Segmentation)一种即插即用(Plug-and-Play)的分割模块,使冻结的多模态模型也能理解像素级语义。
二、方法创新:LENS 框架登场 🧠
LENS 的核心目标是:
让冻结的 MLLM 具备分割能力,而不改变它的原始输出空间。
🧩 (1) Plug-and-Play 思路:冻结 MLLM 主体
传统做法往往会微调整个模型,使其生成 mask-friendly 特征。而 LENS 的创新在于:模型主体(如 LLaVA、Qwen-VL)完全冻结,仅在外部挂载一个轻量级、可训练的 segmentation head。
这样可以:
-
保持语言与视觉特征的统一对齐;
-
避免破坏已有的泛化能力;
-
实现低成本适配与迁移。
⚙️ (2) Attention Map + Keypoint Extraction:从注意力中提取空间信息
LENS 发现,MLLM 的 attention map 中天然包含丰富的空间结构信息。
因此,作者提出一种 关键点提取机制(Keypoint Extraction):
-
从注意力图中选出代表性的空间位置(关键点);
-
将这些点映射为 point-wise 特征向量;
-
与 mask decoder 的特征接口对齐,完成掩码生成。
这种方法无需显式的像素监督,却能有效捕获语义区域边界。
简而言之:LENS 让模型“看哪里、画哪里”,通过关键点桥接语言与像素。
💡 (3) Mask Decoder 接口对齐:让语言特征可直接转为掩码
LENS 在关键点特征与 mask decoder 之间增加了一个映射层。 这一层负责将语言嵌入(Language Embedding)与空间坐标信息结合, 使其输出与传统 segmentation decoder(如 Mask2Former、SAM-style head)兼容。 最终输出即为标准的 segmentation mask, 且整个流程保持端到端的可训练性(仅针对新模块)。
三、实验结果:零样本分割性能全面领先 📊
作者在多个数据集上验证了 LENS 的有效性,包括:
-
ADE20K(通用场景分割)
-
COCO-Stuff(复杂语义理解)
-
Pascal VOC(目标识别)
实验结果表明:
即便在完全冻结主干网络的情况下,LENS 的分割精度仍与微调模型相当甚至更高。
此外,LENS 在跨任务与跨领域(如 open-vocabulary segmentation)中依旧表现稳定,展现出卓越的 零样本泛化能力(Zero-shot Generalization)。
📉 效率表现
LENS 的结构极其轻量,无需反向传播梯度,训练与推理效率高。
在典型的 MLLM(如 Qwen-VL 7B)上,仅需少量显存即可运行。
与重新训练模型相比,显存占用和训练时间均减少超过 70%。
四、优势与局限 ⚖️
✅ 优势
-
🧩 Plug-and-Play 结构:模型可即插即用,无需破坏原结构;
-
🔍 特征层增强:通过关键点方式实现空间语义理解;
-
🧠 保持语言泛化能力:完全冻结主干 MLLM;
-
⚙️ 低成本迁移:仅需训练轻量头部模块。
⚠️ 局限
-
分割精度仍依赖于 attention map 的空间一致性;
-
对高分辨率或极端场景的表现仍有待优化;
-
目前主要适用于静态图像,暂不支持视频或时序输入。
📝 一句话总结
LENS 让多模态大模型拥有“像素级视力”。
它无需重训、无需改结构,只需插入一个轻量模块,
就能让冻结的 MLLM 具备分割与空间理解能力。
更多推荐


所有评论(0)