GPT-4o、Claude、Gemini、Qwen-VL
它们真的“会推理”吗?
一篇最新论文,用 1188 道题,给多模态大模型泼了一盆冷水。


一、一个残酷现实:我们可能一直在“误判”多模态推理能力

过去一年,多模态大模型给人的感觉是:

  • 能看图做数学题

  • 能分析图表

  • 能一步一步“解释推理过程”

于是很多人默认了一件事:

多模态大模型 ≈ 已经具备较强逻辑推理能力

但问题是:
 这些能力,到底是“推理”,还是“识别 + 记忆 + 模板化输出”?

最近,复旦大学、港中文 MMLab、上海 AI Lab 等机构联合提出的 MME-Reasoning,第一次系统性地回答了这个问题。

结论很直接:

当前多模态大模型的“逻辑推理能力”,被明显高估了。


二、MME-Reasoning 做对了什么?一句话:它终于“只考推理”

以往的多模态评测,大多有三个通病:

  1. 推理类型混乱

  2. 大量题目本质是视觉感知

  3. 依赖高阶专业知识

MME-Reasoning 的设计思路非常“狠”。


明确区分三种逻辑推理

论文严格采用逻辑学中的经典分类:

推理类型 简单理解 模型表现
演绎推理 按规则一步步算 ✅ 最稳定
归纳推理 从例子总结规律 ⚠️ 一般
溯因推理 从结果反推原因 ❌ 最弱

作者直接点名:
 溯因推理(Abductive Reasoning)才是真实世界中最重要的能力
 也是当前模型最不行的能力


去感知、去“拼知识”,只剩下逻辑

MME-Reasoning 在数据构建上做了大量人工清洗:

  •  “一眼看出来”的图像题 → 删

  •  依赖竞赛数学、专业物理 → 删

  •  只保留 K12 水平 + 必须推理才能解的题

换句话说:

在这个 benchmark 上,模型没有任何“取巧空间”。


三、1188 道题,主流模型成绩一览

作者测试了几乎所有你熟悉的模型:

  • GPT-4o、Claude、Gemini

  • o1 / o4-mini / Seed1.5-VL-Thinking

  • Qwen-VL、InternVL、LLaVA 等主流开源模型

结果

没有一个模型,能让人放心地说:它“真的会多模态推理”。

  • 最强模型:Gemini-2.5-Pro-Thinking ≈ 60%

  • 大量模型:40% 左右

  • 部分开源模型:30% 以下

这不是“模型不行”,而是:

这个 benchmark 终于测到了“硬能力”。


一个统一结论:模型极度偏科

几乎所有模型都呈现出同一个模式:

  • 演绎推理:分数最高

  • 归纳推理:尚可

  • 溯因推理:全面拉胯

在开源模型中:

溯因推理平均比演绎推理低将近 10 个百分点

这意味着什么?

 模型适合“算答案”
 但不适合“探索可能性”


四、Thinking Model:真的“想得更好”,还是“想得更长”?

推理 token 变多,确实能涨分

论文一个很有意思的发现是:

  • 推理过程越长,整体准确率越高

  • Thinking Model 会在难题上自动“多想一会儿”

这也是 o1、o4-mini、Seed-Thinking 表现更好的原因。


但问题也很明显:性价比越来越低

随着 token 数暴涨:

  • 推理开始重复

  • 反复验证同一条思路

  • 准确率提升开始明显放缓

一句话总结:

多模态推理已经进入“堆算力但不优雅”的阶段。


五、Rule-based RL:并没有拯救多模态推理

很多人寄希望于 R1-style 的规则强化学习。

但论文给出的结论很现实:

  • 在多模态场景中,效果 极不稳定

  • 小模型(7B)甚至会 性能下降

  • 泛化能力不足

作者的态度非常明确:

多模态推理 ≠ 纯文本推理 + 图片


六、这篇论文真正重要的地方

MME-Reasoning 并不是为了“重新排榜”,而是:

  1. 第一次系统拆解了多模态推理能力

  2. 揭示了模型在真实推理任务中的能力上限

  3. 明确指出未来方向:溯因推理 + 规划能力

对工程和研究都很有价值:

  •  不要在复杂决策场景中过度相信模型

  •  把多模态模型当“强辅助”,而不是“自动推理器”


七、总结一句狠话

多模态大模型已经很会“看”,
但离“想明白一件事”,
还差一个时代。

MME-Reasoning 并不是唱衰,而是让我们终于看清:
通往真正智能的路,才刚刚开始。

 

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐