文章:Segmentation as a Plug-and-Play Capability for Frozen Multimodal LLMs
代码:暂无
单位:暂无


一、问题背景:分割任务与多模态模型的融合困境

近年来,多模态大语言模型(Multimodal Large Language Models, MLLMs)如 GPT-4V、Qwen2.5-VL、LLaVA 等快速崛起,  使 AI 具备了“看图说话”“跨模态推理”等能力。  然而,让 MLLM 理解到像素级别的细节(Segmentation) 仍然是一个长期难题。

分割任务需要模型具备精确的空间理解,而 MLLM 的输出通常是语言形式。
如何在不重新训练模型的前提下,让它具备像素级感知能力?

目前主流方法存在三大问题:

  1. ⚙️ 需要微调(Finetuning) —— 改动模型结构,破坏泛化性;

  2. 💾 改变输出空间(Output Space) —— 语言与掩码空间不兼容;

  3. 🧩 高训练成本 —— 每次新任务都需重新适配与训练。

为了解决这些痛点,作者提出了一种新的分割范式:

LENS (Leveraging kEypoiNts for MLLMs’ Segmentation)一种即插即用(Plug-and-Play)的分割模块,使冻结的多模态模型也能理解像素级语义。


二、方法创新:LENS 框架登场 🧠

LENS 的核心目标是:

让冻结的 MLLM 具备分割能力,而不改变它的原始输出空间。

🧩 (1) Plug-and-Play 思路:冻结 MLLM 主体

传统做法往往会微调整个模型,使其生成 mask-friendly 特征。而 LENS 的创新在于:模型主体(如 LLaVA、Qwen-VL)完全冻结,仅在外部挂载一个轻量级、可训练的 segmentation head。

这样可以:

  • 保持语言与视觉特征的统一对齐;

  • 避免破坏已有的泛化能力;

  • 实现低成本适配与迁移。


⚙️ (2) Attention Map + Keypoint Extraction:从注意力中提取空间信息

LENS 发现,MLLM 的 attention map 中天然包含丰富的空间结构信息。
因此,作者提出一种 关键点提取机制(Keypoint Extraction)

  1. 从注意力图中选出代表性的空间位置(关键点);

  2. 将这些点映射为 point-wise 特征向量;

  3. 与 mask decoder 的特征接口对齐,完成掩码生成。

这种方法无需显式的像素监督,却能有效捕获语义区域边界。

简而言之:LENS 让模型“看哪里、画哪里”,通过关键点桥接语言与像素。


💡 (3) Mask Decoder 接口对齐:让语言特征可直接转为掩码

LENS 在关键点特征与 mask decoder 之间增加了一个映射层。  这一层负责将语言嵌入(Language Embedding)与空间坐标信息结合,  使其输出与传统 segmentation decoder(如 Mask2Former、SAM-style head)兼容。 最终输出即为标准的 segmentation mask,  且整个流程保持端到端的可训练性(仅针对新模块)。


三、实验结果:零样本分割性能全面领先 📊

作者在多个数据集上验证了 LENS 的有效性,包括:

  • ADE20K(通用场景分割)

  • COCO-Stuff(复杂语义理解)

  • Pascal VOC(目标识别)

实验结果表明:

即便在完全冻结主干网络的情况下,LENS 的分割精度仍与微调模型相当甚至更高。

此外,LENS 在跨任务与跨领域(如 open-vocabulary segmentation)中依旧表现稳定,展现出卓越的 零样本泛化能力(Zero-shot Generalization)


📉 效率表现

LENS 的结构极其轻量,无需反向传播梯度,训练与推理效率高。
在典型的 MLLM(如 Qwen-VL 7B)上,仅需少量显存即可运行。
与重新训练模型相比,显存占用和训练时间均减少超过 70%。


四、优势与局限 ⚖️

✅ 优势

  • 🧩 Plug-and-Play 结构:模型可即插即用,无需破坏原结构;

  • 🔍 特征层增强:通过关键点方式实现空间语义理解;

  • 🧠 保持语言泛化能力:完全冻结主干 MLLM;

  • ⚙️ 低成本迁移:仅需训练轻量头部模块。

⚠️ 局限

  • 分割精度仍依赖于 attention map 的空间一致性;

  • 对高分辨率或极端场景的表现仍有待优化;

  • 目前主要适用于静态图像,暂不支持视频或时序输入。


📝 一句话总结

LENS 让多模态大模型拥有“像素级视力”。
它无需重训、无需改结构,只需插入一个轻量模块,
就能让冻结的 MLLM 具备分割与空间理解能力。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐