微软:多模态大模型能力解耦分析

📖标题:What MLLMs Learn about When they Learn about Multimodal Reasoning: Perception, Reasoning, or their Integration?
🌐来源:arXiv, 2510.01719
🌟摘要
多模态推理模型最近在诸如经验级几何等具有挑战性的领域显示出了希望,但它们的评估仍然以聚合精度为主,这是一个单一的分数,它掩盖了模型在哪里以及如何改进。我们引入了MATHLENS,这是一个旨在解开多模态推理的子技能的基准,同时保持教科书式几何问题的复杂性。该基准将性能分为三个组件:感知:从原始输入中提取信息、推理:对可用信息进行操作和集成:选择相关的感知证据并将其应用于推理中。为了支持每个测试,我们提供注释:视觉图、文本描述,以孤立地评估推理、需要两种模式的受控问题和用于细粒度感知技能的探针,所有这些都源自问题的符号规范,以确保一致性和鲁棒性。我们的分析表明,不同的训练方法的效果不均匀:首先,强化学习主要加强了感知,尤其是在文本监督的支持下,而文本 SFT 通过反射推理间接提高了感知。其次,推理仅与感知一起改进。第三,整合仍然是最弱的容量,残余错误集中在其他技能上。最后,鲁棒性发散:RL提高了图变化下的一致性,而多模态SFT通过过拟合减少了它。我们将发布所有数据和实验日志。
🛎️文章简介
🔸研究问题:多模态大型语言模型(MLLM)在进行多模态推理时,如何分辨出来自感知、推理还是两者的整合的问题?
🔸主要贡献:论文提出了MATHLENS benchmark,旨在分离多模态推理中的感知、推理及其整合能力,提供了新方法以分析模型的性能。
📝重点思路
🔸引入MATHLENS基准,通过926道几何问题及其8种视觉修改,设计实验以分离感知、推理和整合能力。
🔸采用四种相关注释,分别测试感知(图形)、推理(文本描述)、多模态问题和微调探测器。
🔸通过先训练文本后训练图像的方式,以评估不同训练策略对模型的影响。
🔸进行对比实验,从开放模型中收集数据,评估7-9B参数范围内的多模态推理模型的表现。
🔎分析总结
🔸感知能力主要通过强化学习增强,且在已有文本推理能力的前提下效果更佳。
🔸多模态推理训练同时促进感知与推理的提升,但推理能力并未表现出独立的额外增益。
🔸整合能力是三者中提升最少的,表明存在持续的整合错误,成为主要的失败模式。
🔸在视觉输入变化的情况下,强化学习提高了一致性,而多模态监督微调则导致了过拟合,从而降低了一致性。
💡个人观点
论文通过基准明确分离多模态推理的关键能力,使得对模型性能的评估更加细致和准确。
🧩附录


更多推荐


所有评论(0)