想象一下,你让家里的机器人去“拿起桌上被压在最底下的小红书”。对于人类来说,我们会自然而然地想:先移开书上面的鼠标,再拿走键盘,最后才能抽出那本书。

但是,现在最聪明的AI能做到吗?

浙江大学与悉尼大学等机构的最新研究《SpatiaLQA: A Benchmark for Evaluating Spatial Logical Reasoning in Vision-Language Models》给出了一个扎心的答案:不能 。强如 GPT-4o,在面对这种需要结合“空间感知”和“步骤推理”的任务时,也会显得像个“笨蛋” 。


一、 什么是“空间逻辑推理”(Spatial Logical Reasoning)?

以往,我们评估视觉语言大模型(VLMs),通常考查两项能力:

  1. 常规视觉问答(VQA): 比如问“球员的帽子和盘子颜色一样吗?”大模型看一眼就能答出“不一样,帽子是蓝的,盘子是白的” 。

  2. 常规逻辑推理: 比如丢给它一个几何题,它能通过数学公式一步步推导出正确选项 。

但在真实的物理世界里,这远远不够。研究团队首次明确提出了**“空间逻辑推理”**的概念:它不仅要求模型理解复杂场景中物体之间的空间关系,还要求模型能梳理出完成多步任务的逻辑依赖关系 。

简而言之:空间理解 + 严密逻辑 = 空间逻辑推理
三种推理能力的直观对比

(提示:图1左侧展示了常规VQA,中间展示了抽象数学推理,右侧则是本研究的核心——空间逻辑推理。可以看到,面对凌乱的桌面,大模型错误地认为只要移除键盘就能拿书,完全没注意到键盘上的鼠标和数据线 。)

这种能力是未来具身智能(Embodied AI)认知的核心基础 。毕竟,如果你连看图想步骤都想不对,怎么敢让你去实际操作机械臂呢?


二、 史上首个!SpatiaLQA 炼狱级测试场诞生

为了测试各大模型的能力,研究团队耗费心血,构建了名为 SpatiaLQA 的大规模基准数据集 。

这个数据集有多硬核?

  • 规模庞大: 包含来自13类真实室内场景的 241 张图片,衍生出高达 9,605 个图文问答对 。

  • 极其复杂: 完成这些任务所需的步骤数从 2 步到 10 步不等,牵涉到上千种日常物品 。

为了保证数据的逻辑严密性,团队采用了堪比“俄罗斯套娃”的三阶段数据收集法

  1. 人工标注(Manual Annotation): 标注员精心设计复杂场景并人工写下初始操作步骤 。

  2. 子图提取增强(Subgraph Extraction Augmentation): 根据原有步骤的逻辑依赖,截取其中一部分,生成新的子任务 。

  3. 图扩展增强(Graph Expansion Augmentation): 在原有基础上,通过启发式方法再人为添加合理的后续步骤,让任务变得更长、更难 。

SpatiaLQA 数据集的三阶段构建流程

(提示:图4清晰展示了从原始人工标注,到拆分子图,再到扩展复杂图的完整数据增强流水线 。)


三、 揭榜时刻:41款顶流大模型“全军覆没”?

数据准备就绪,研究人员对当前主流的 41 款多模态大模型(包括开源和闭源)进行了一场“大考” 。

如何评分?
考虑到开放式回答很难用传统的标准答案直接比对,团队设计了一套极具巧思的自动评估系统:

  • 首先,请 GPT-4o 当“阅卷老师”,对模型的预测步骤和真实步骤进行两两语义比对,生成匹配矩阵 。

  • 接着,使用**匈牙利算法(Hungarian algorithm)**过滤掉冗余匹配,实现最优的一对一匹配 。

  • 最后,分别计算**动作内容(Content)的准确度 FcF_cFc前置条件(Precondition)**的准确度 FpF_pFp
    基于GPT-4o和匈牙利算法的评估匹配过程

(提示:图5展示了如何将预测步骤(红圈)与真实步骤(蓝圈)进行精准的一对一匹配打分 。)

考试结果令人大跌眼镜:
人类在这项任务上的各项得分均超过 90% 。然而,所有的AI大模型,表现都不及格! 即使是地表最强的 GPT-5(推断版本)、GPT-4o 或是 Claude-3.5,在预测步骤动作(FcF_cFc)上尚能拿到及格分,但在预测前置条件FpF_pFp,即做这件事之前必须先做哪件事)时,得分断崖式下跌 。

这意味着:大模型严重缺乏因果推理能力。它们也许知道要把东西移走,但完全不知道该按什么顺序移! 并且,任务步骤越多,模型“翻车”越惨 。


四、 破局之法:RSGAR(递归场景图辅助推理)

指出问题只是第一步,解决问题才是关键。既然大模型脑子“一团乱麻”,我们就帮它把场景理清。

研究团队提出了一种名为 递归场景图辅助推理(RSGAR, Recursive Scene Graph Assisted Reasoning) 的新方法 。

这个方法的精髓在于“庖丁解牛”:

  1. 深度与分割双管齐下: 首先利用 Depth Anything V2 提取场景深度图,用 SAM 提取物体分割图,让模型“看清”物体的轮廓和前后距离 。

  2. 递归生成场景图(Scene Graph): 不让大模型一次性看全图,而是以任务目标为中心,像剥洋葱一样,一圈一圈往外梳理。找到目标物体 -> 找到直接挨着它的物体 -> 再找到挨着外围物体的物体… 最终构建起一个清晰的空间关系图 。

  3. 带着图谱去做题: 最后,把这个结构化的场景图连同原始问题一起喂给大模型,让它给出最终答案 。

RSGAR 方法的流程概览

(提示:图8生动展示了借助视觉基础模型,如何将复杂的真实画面一层层抽丝剥茧,转化为大模型容易理解的递归场景图 。)

效果如何?
实验证明,在包含 8-10 个步骤的地狱级难度任务中,RSGAR 方法显著提升了 GPT-4o 的表现,完胜单纯添加深度图或物理常识的其他基准方法 !


五、 结语

《SpatiaLQA》这项工作给我们敲响了警钟:在通往真正的通用人工智能(AGI)和高级机器人的道路上,我们不能只沉迷于大模型的“能说会道”或“秒解高数”,物理世界的空间空间逻辑理解,才是目前亟待跨越的鸿沟

希望这项由中国学者领衔的开源研究,能成为大模型进化路上的一块重要基石。目前,该项目的数据和代码已全部开源!

  • 论文标题:SpatiaLQA: A Benchmark for Evaluating Spatial Logical Reasoning in Vision-Language Models
  • 论文链接:https://arxiv.org/abs/2602.20901v1
  • 代码链接:https://github.com/xieyc99/SpatiaLQA
Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐