笔记整理:姜一诺,浙江大学硕士,研究方向为大语言模型

论文链接:https://openreview.net/pdf?id=qYkhCah8OZ

发表会议:NeurIPS 2025 Oral

1. 动机

基于大语言模型(LLMs)发展而来的多模态大语言模型(MLLMs)在图像描述、视觉问答等众多以视觉为中心的任务中表现出色。然而,面对知识密集型的视觉语言任务时,这类模型往往表现不佳。为解决这一问题,多模态检索增强生成方法(MRAG)被提出,通过从外部数据中检索情境知识来辅助模型生成准确回答;然而,当前研究对于如何有效利用所检索到的情境知识仍探索不足,限制了该方法的实际效果。通过考察现有采用检索增强生成机制的多模态模型,作者发现即使检索到了高质量知识,模型也常常未能充分利用这些信息。这主要源于两方面原因:

(1) 视觉标记与上下文标记之间存在注意力偏差,模型在浅层往往更关注图像标记,而图像本身对于知识密集型问题通常信息不足,同时模型对所有上下文标记给予均等关注,未能突出查询相关的重要知识;

(2)参数化知识与检索所得的上下文知识之间可能发生冲突,即使情境知识正确,模型仍倾向于过度依赖自身参数知识,导致上下文知识利用不足并产生错误回答。尽管这种对参数知识的偏向在上下文知识不可靠时具有一定作用,但如何平衡二者并发挥其互补优势,对于生成准确回答至关重要。

为此,本研究提出了一种无需训练即插即用的方法,通过动态调整注意力分配并平衡两类知识,以促进多模态大语言模型更有效地利用检索增强生成中的上下文知识,从而提升其在多种任务中的回答准确性。

2. 贡献

本文的主要贡献有:

(1)深入分析并揭示了阻碍知识利用的关键因素。 首次深入探究MLLMs在利用检索知识时存在的根本问题,明确指出并分析了“注意力偏差”和“知识冲突”是导致检索知识无法被有效利用的两个关键障碍。

(2)提出了一种无需训练、即插即用的创新方法ALFAR。 该方法无需额外训练,可以方便地集成到现有模型中,通过动态地重新分配注意力以及有效平衡模型内部参数化知识与外部检索知识,从而显著提升知识利用效率。

(3)通过广泛实验验证了方法的有效性与普适性。在多种生成式和判别式基准测试上进行了大量实验,充分证明了ALFAR方法的优越性能和强大泛化能力,表明其能够广泛应用于不同的多模态任务,并始终保持出色的表现。

3. 方法

本文提出的框架包含两个分支,分别用于处理参数化知识和上下文知识(图1)。上下文分支设计了注意力重分配机制,通过基于查询-上下文相关性自适应调整模型对上下文标记的关注,以解决注意力偏差并提升上下文知识的利用率。此外,网络在输出逻辑层自适应融合两种知识,通过模型注意力动态捕获两者相对重要性,以缓解知识冲突。

图1 总体框架图

3.1 注意力重分配机制

针对图像标记的注意力偏好及对上下文标记的均匀关注问题,提出以下解决方案:

(1)基于检索相似度α(反映上下文可靠性)自适应降低对图像标记的注意力权重(公式5);

(2)引入查询-上下文相关性评分(公式6),增强模型对相关上下文标记的关注(公式7);

(3)通过softmax重新分配注意力,并自回归应用于后续标记预测。

3.2 自适应知识融合

为解决参数化知识与上下文知识的冲突:

(1)分别通过仅输入查询/图像和增加上下文输入的两个前向过程,分离得到参数化知识(公式8)和上下文知识(公式9);

(2)利用图像标记总注意力和上下文标记总注意力衡量两类知识的可靠性(公式10);

(3)在每步解码时动态融合两类知识(公式11),通过权重调整实现平衡。

该方法通过协同优化注意力分配与知识融合,显著提升多模态大语言模型的知识利用效率。

4. 实验

4.1 数据集与基准

采用三种知识密集型数据集,包括自由形式数据集,包含专家整理验证的高质量信息检索数据集Human,以及涵盖 Wikidata 多种实体的 INFOSEEKwiki;多选判别式数据集,包括 Infoseek 和 ViQuAE,用于评估跨模态知识冲突;基于知识的数据集,含 OK-VQA、AOK-VQA 和百科问答数据集 E-VQA,广泛用于评估需常识知识的任务。以 6 个代表性多模态大语言模型为骨干,包括 LLaVA-1.5(7B/13B)、InstructBLIP(7B/13B)、Shikra(7B)、MiniGPT-4(7B)、LLaVA-Next(7B)和 Qwen2.5-VL(3B)。包含 5 种无训练解码方法(对比解码 CD、自适应上下文感知解码 AdaCAD 等),用于缓解大语言模型知识冲突;另有 2 种幻觉缓解方法(视觉对比解码 VCD、全局与局部注意力组装 AGLA)。

4.2实验结果

表2 展示了 4 个代表性多模态大语言模型(MLLMs)在两个自由形式生成式知识密集型数据集上的实验结果。可以看出,所提出的 ALFAR 方法在所有模型和数据集上,均以显著优势(整体准确率平均提升约 2.5%)持续优于常规解码策略。此外,ALFAR 还超越了当前最先进的解码方法,证明其在更高效利用上下文知识方面的有效性。

表3 展示了 6 个多模态大语言模型(MLLMs)在两个多选判别式数据集上的实验结果。值得注意的是,ALFAR 相较于常规解码策略平均提升 6.6%,且始终以显著优势超越当前最先进的解码方法,凸显其在多样任务中的有效性。

除实体知识类数据集外,研究者还在常识知识类数据集(OK-VQA 、AOK-VQA 和百科问答数据集 E-VQA)上,基于LLaVA-1.5进行了实验。如表 4 所示,ALFAR 相较于常规解码策略提升了 15.2%,且持续优于当前最先进的解码方法,凸显其在处理更广泛知识密集型任务中的有效性。

5. 总结

本文研究发现,目前MLLMs在知识密集型任务中难以充分利用检索到的知识,这一局限源于两类关键因素:对不同 tokens 的注意力偏差,以及参数知识与上下文知识间的知识冲突。为解决这些问题,本文提出无训练、即插即用的方法 ALFAR,通过动态重分配注意力和协调两种知识来提升模型性能。具体而言,ALFAR 会基于查询 - 上下文相关性,将注意力从视觉 tokens 自适应转移到上下文 tokens 以减轻注意力偏差;同时在输出对数层面解耦并平衡两类知识,有效化解冲突。多项 MLLMs 及基准测试的实验表明,ALFAR 能持续以显著优势超越当前最先进方法。


OpenKG

OpenKG(中文开放知识图谱)旨在推动以中文为核心的知识图谱数据的开放、互联及众包,并促进知识图谱算法、工具及平台的开源开放。

点击阅读原文,进入 OpenKG 网站。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐