多模态大模型被高估了吗?MME-Reasoning 直接把“推理能力”打回原形
GPT-4o、Claude、Gemini、Qwen-VL
它们真的“会推理”吗?
一篇最新论文,用 1188 道题,给多模态大模型泼了一盆冷水。
一、一个残酷现实:我们可能一直在“误判”多模态推理能力
过去一年,多模态大模型给人的感觉是:
-
能看图做数学题
-
能分析图表
-
能一步一步“解释推理过程”
于是很多人默认了一件事:
多模态大模型 ≈ 已经具备较强逻辑推理能力
但问题是:
这些能力,到底是“推理”,还是“识别 + 记忆 + 模板化输出”?
最近,复旦大学、港中文 MMLab、上海 AI Lab 等机构联合提出的 MME-Reasoning,第一次系统性地回答了这个问题。
结论很直接:
当前多模态大模型的“逻辑推理能力”,被明显高估了。
二、MME-Reasoning 做对了什么?一句话:它终于“只考推理”
以往的多模态评测,大多有三个通病:
-
推理类型混乱
-
大量题目本质是视觉感知
-
依赖高阶专业知识
MME-Reasoning 的设计思路非常“狠”。
明确区分三种逻辑推理
论文严格采用逻辑学中的经典分类:
| 推理类型 | 简单理解 | 模型表现 |
|---|---|---|
| 演绎推理 | 按规则一步步算 | ✅ 最稳定 |
| 归纳推理 | 从例子总结规律 | ⚠️ 一般 |
| 溯因推理 | 从结果反推原因 | ❌ 最弱 |
作者直接点名:
溯因推理(Abductive Reasoning)才是真实世界中最重要的能力
也是当前模型最不行的能力
去感知、去“拼知识”,只剩下逻辑
MME-Reasoning 在数据构建上做了大量人工清洗:
-
“一眼看出来”的图像题 → 删
-
依赖竞赛数学、专业物理 → 删
-
只保留 K12 水平 + 必须推理才能解的题
换句话说:
在这个 benchmark 上,模型没有任何“取巧空间”。
三、1188 道题,主流模型成绩一览
作者测试了几乎所有你熟悉的模型:
-
GPT-4o、Claude、Gemini
-
o1 / o4-mini / Seed1.5-VL-Thinking
-
Qwen-VL、InternVL、LLaVA 等主流开源模型
结果
没有一个模型,能让人放心地说:它“真的会多模态推理”。
-
最强模型:Gemini-2.5-Pro-Thinking ≈ 60%
-
大量模型:40% 左右
-
部分开源模型:30% 以下
这不是“模型不行”,而是:
这个 benchmark 终于测到了“硬能力”。
一个统一结论:模型极度偏科
几乎所有模型都呈现出同一个模式:
-
演绎推理:分数最高
-
归纳推理:尚可
-
溯因推理:全面拉胯
在开源模型中:
溯因推理平均比演绎推理低将近 10 个百分点
这意味着什么?
模型适合“算答案”
但不适合“探索可能性”
四、Thinking Model:真的“想得更好”,还是“想得更长”?
推理 token 变多,确实能涨分
论文一个很有意思的发现是:
-
推理过程越长,整体准确率越高
-
Thinking Model 会在难题上自动“多想一会儿”
这也是 o1、o4-mini、Seed-Thinking 表现更好的原因。
但问题也很明显:性价比越来越低
随着 token 数暴涨:
-
推理开始重复
-
反复验证同一条思路
-
准确率提升开始明显放缓
一句话总结:
多模态推理已经进入“堆算力但不优雅”的阶段。
五、Rule-based RL:并没有拯救多模态推理
很多人寄希望于 R1-style 的规则强化学习。
但论文给出的结论很现实:
-
在多模态场景中,效果 极不稳定
-
小模型(7B)甚至会 性能下降
-
泛化能力不足
作者的态度非常明确:
多模态推理 ≠ 纯文本推理 + 图片
六、这篇论文真正重要的地方
MME-Reasoning 并不是为了“重新排榜”,而是:
-
第一次系统拆解了多模态推理能力
-
揭示了模型在真实推理任务中的能力上限
-
明确指出未来方向:溯因推理 + 规划能力
对工程和研究都很有价值:
-
不要在复杂决策场景中过度相信模型
-
把多模态模型当“强辅助”,而不是“自动推理器”
七、总结一句狠话
多模态大模型已经很会“看”,
但离“想明白一件事”,
还差一个时代。
MME-Reasoning 并不是唱衰,而是让我们终于看清:
通往真正智能的路,才刚刚开始。
更多推荐



所有评论(0)