当我们让最强 AI 看真实照片解决实际问题,最强大模型集体翻车 —— AgentVista: 超高难度多模态 Agent 评测

我们提出了 AgentVista —— 一个面向真实视觉场景的超高难度多模态 Agent 评测基准。209 道精心策划的任务横跨 7 大领域 25 个子方向,要求模型在复杂视觉线索中完成多步工具调用与推理。结果令人震惊:即便是当前最强的 Gemini-3-Pro,整体准确率也仅有27.27%。

论文标题: AgentVista: Evaluating Multimodal Agents in Ultra-Challenging Realistic Visual Scenarios
机构: 香港科技大学 (HKUST), 浙江大学, 新加坡国立大学, 北卡罗来纳大学教堂山分校
论文链接: https://arxiv.org/abs/2602.23166
项目主页: https://agentvista-bench.github.io/
GitHub: https://github.com/hkust-nlp/AgentVista

一、为什么我们需要 AgentVista?

人类天生就能无缝整合多感官信息来解决复杂的现实问题。随着 GPT-5、Gemini-3、Claude-Opus-4 等多模态大模型的快速演进,构建具有视觉智能体能力(Visual Agentic Intelligence)的 AI Agent 成为了前沿研究的核心方向。我们期待这些 Agent 能够真正"看懂世界并采取行动"——在超市货架前扫描商品标签并结合营养信息满足用户的健康约束,在设备故障时将故障照片与电路原理图关联起来精准定位问题,在装修时跨越多张实景照片匹配地板样式、检索产品规格并计算最终费用。

然而,一个关键问题浮出水面:

现有的 Benchmark 真的能衡量 Agent 在真实场景中的能力吗?

答案是:远远不够。我们系统分析了当前主流多模态 Agent 评测,发现它们存在两大核心缺陷

缺陷一:Capability-Specific Evaluation(能力碎片化评测)。现有 Benchmark 往往只聚焦于某一项特定能力——有的只测视觉操作(如裁剪、缩放),有的只测网页浏览,有的只测代码生成。这种"单项考试"模式根本无法评估一个通用型 Agent 在长链条工作流中协调多种技能的真实能力

缺陷二:Realism 与 Difficulty 之间的失衡。真实的 Agent 任务之所以困难,是因为它们同时面临杂乱的视觉证据长链条的受约束工具调用。然而很多 Benchmark 为了增加难度,反而简化了视觉输入或采用了偏离日常工作流的工具模式。例如,VisualToolBench 会对输入图像进行预处理以适配特定视觉操作——虽然这有利于评测视觉操作能力,但也将问题从"在自然视觉状态下推理"转变成了"在精心策划的输入上操作",偏离了真实场景的挑战。

为此,我们提出了 AgentVista —— 一个以真实视觉场景为核心,要求自然交错的混合工具调用(Interleaved Hybrid Tool Use),同时保证答案可验证的超高难度多模态 Agent 评测基准。AgentVista 包含 209 道任务,横跨 7 大领域 25 个子方向,每一道任务都扎根于细节丰富的真实视觉状态(日常照片、截图、技术图纸),要求 Agent 反复锚定视觉线索、检索外部信息并验证中间决策——这正是现实世界中多模态智能体面临的真正挑战。

AgentVista 示例任务:一个真实的家居装修场景,Agent 需要跨图匹配地板样式、验证目标房间、检索产品规格并计算最终费用

二、AgentVista 的三大设计原则

1. Vision-Centric:视觉是解题的核心

每一道任务的关键证据都必须从图像中获取。图像是真实拍摄或截图,包含细微但关键的视觉线索——标签上的小字、电路板上的芯片型号、地图中的隐藏路径。文字描述无法替代视觉观察,纯文本搜索无法绕过视觉理解。

2. Interleaved Hybrid Tool Use:自然交错的多工具协作

每道任务至少需要两种以上工具类别的交错调用。例如:先用 Code Interpreter 裁剪放大图像细节,再用 Image Search 反向搜索,接着 Web Search 查询规格参数,最后用代码计算最终答案。这正是真实用户解决问题的自然工作流。

3. Verifiable:答案确定、评测可靠

每道任务都有简洁明确的标准答案(数字、实体名称或简短描述),避免主观评判带来的评测噪声,评测过程如同数学题一样客观稳定。

三、数据构建:从 30 万张候选图到 209 道精品任务

AgentVista 采用了极其严格的 四阶段筛选流程,从超过 30 万张候选图像中层层过滤,最终仅保留 209 道任务——淘汰率高达 99.93%。

AgentVista 四阶段数据构建流程
AgentVista 四阶段数据构建流程

四个阶段

阶段

内容

产出

Stage 1: Agent-Centric Filtering

使用 Claude-Opus-4 进行模型辅助筛选 + 人工审核,过滤视觉信息不足的图片

~568 候选(0.19%)

Stage 2: Expert Finalization

专家标注员将任务改写为真实用户请求,确保 vision-centric 且答案确定

315 道任务

Stage 3: Execution Filtering

在工具环境中实际执行验证,保留需要跨工具类别交错调用的任务

241 道任务

Stage 4: Two-Round Verification

两轮人工复核,移除证据不充分、答案不稳定的样本

209 道最终任务

每道任务的人工构建成本约 4 小时,专家求解时间约 30 分钟

四、Benchmark 全貌:7 大领域、25 个子方向

AgentVista 覆盖了生活与专业场景中最具代表性的 7 大领域:

AgentVista 数据分布:7 大领域 25 个子方向

统计项

数值

总任务数

209

总图片数

308

一级类别

7

二级类别

25

平均 Query 长度

401.4 字符

单图任务

151(72.2%)

多图任务

58(27.8%)

七大领域涵盖:Technology(技术)Commerce(商业)Geography(地理)Entertainment(娱乐)Society(社会生活)Academics(学术)Culture(文化)

下图展示了来自不同领域的采样任务示例:

AgentVista 各领域采样示例
AgentVista 各领域采样示例

五、工具环境:四大核心工具

AgentVista 为 Agent 提供了 4 种核心工具,覆盖真实多模态工作流:

工具

功能

典型用途

Web Search

网页搜索

查询产品参数、历史事件、技术规格

Image Search

图像搜索(正向/反向)

以图搜图、识别物品来源

Visit

访问网页并提取内容

深入阅读搜索结果、获取详细信息

Code Interpreter

Python 代码执行(PIL, NumPy, OpenCV等)

图像裁剪/放大、数值计算、数据分析

六、核心实验结果:最强模型也只有 27%

我们评测了当前 14 个主流模型,包括 GPT-5 系列、Gemini-3 系列、Claude 系列、Grok-4 以及开源模型。结果揭示了一个残酷的现实:

主实验结果

Model

Comm.

Geog.

Ent.

Tech.

Soc.

Acad.

Cult.

Overall

Avg Turns

Gemini-3-Pro

16.67

28.21 20.51

32.35

32.00

40.00 40.00 27.27

6.67

GPT-5

23.81

23.08

12.82

35.29

28.00

26.67

26.67

24.40

12.67

GPT-5.2

21.43

17.95

20.51

38.24

24.00

33.33

20.00

24.40

13.85

GPT-5.1

23.81

12.82

15.38

26.47

24.00

40.00 40.00

22.97

17.14

Gemini-3-Flash

16.67

17.95

10.26

29.41

28.00

40.00

20.00

21.05

7.78

o3

21.43

15.38

7.69

23.53

40.00

26.67

13.33

20.10

13.18

Claude-Opus-4.1

11.90

23.08

10.26

29.41

16.00

26.67

13.33

18.18

7.28

Claude-Sonnet-4.5

11.90

23.08

7.69

26.47

24.00

20.00

13.33

17.70

9.99

Grok-4

11.90

23.08

7.69

20.59

28.00

0.00

0.00

14.83

16.44

Qwen3-VL-235B

7.14

7.69

7.69

26.47

16.00

20.00

13.33

12.92

2.34

关键发现

1. 整体难度极高,提升空间巨大

最强的 Gemini-3-Pro 整体准确率仅 27.27%,意味着每 4 道题只能答对 1 道。这与现有 Benchmark 上动辄 80-90% 的成绩形成了鲜明对比,真实揭示了当前多模态 Agent 的能力边界。

2. 没有模型能"通吃"所有领域

  • GPT-5 系列在 Technology 和 Commerce 上领先

  • Gemini-3-Pro 在 Geography、Culture 上表现最佳

  • Claude 系列在需要仔细阅读和约束遵循的任务上更稳健

  • 各家模型都有明显的"偏科"现象

3. 多图输入并不一定更难

出乎意料的是,多图任务的表现往往优于单图任务。例如 Gemini-3-Pro 在多图任务上达到 36.84%,远高于单图的 23.68%。这说明多角度视觉证据反而降低了歧义性,真正的瓶颈在于长链条的工具调用和约束追踪

七、深度分析:模型到底在哪里翻车?

工具使用模式差异显著

不同模型的工具使用偏好对比
不同模型的工具使用偏好对比
  • GPT-5 系列重度依赖 Code Interpreter,尤其是图像裁剪(CROP)操作

  • Gemini 和 Claude 系列更偏好 Web Search 驱动的检索式工作流

  • Image Search 在所有模型中使用频率最低,但对特定任务不可或缺

错误类型分析

四个模型的错误类型分布
四个模型的错误类型分布

最主要的失败原因是 Visual Misidentification(视觉误识别)——占据了所有模型错误的最大比例。模型在细粒度视觉理解上的一个小错误(看错标签、混淆相似元器件、漏掉微小标记),会像多米诺骨牌一样引发后续检索和推理的连锁错误。

第二大错误来源是 Knowledge Hallucination(知识幻觉)——模型编造看似合理但缺乏依据的事实,而非基于图像和检索到的信息进行推理。

工具消融实验

工具消融实验结果
工具消融实验结果

设置

Gemini-3-Pro

Claude-Sonnet-4.5

Full Tool(全部工具)

27.27% 17.70%

Vision Only(仅视觉工具)

20.10%

17.22%

Search Only(仅搜索工具)

26.32%

13.40%

No Tool(无工具)

18.18%

13.40%

实验表明,混合工具协作 > 单一工具。有趣的是,Gemini-3-Pro 仅用搜索工具就能接近全工具表现(26.32% vs 27.27%),体现了其强大的视觉感知能力;而 Claude-Sonnet-4.5 在移除搜索后性能大幅下降,更依赖检索辅助。

八、Test-Time Scaling:采样更多次能救命吗?

我们用 Gemini-3-Flash 探索了 Test-Time Scaling 的效果:

K(采样次数)

Random@K

Best-of-K

Pass@K

1

21.05

21.05

21.05

2

19.11

24.88

26.07

4

18.23

26.32

34.22

8

17.09

28.23

42.59

16

18.05

30.62

51.67

  • 随机采样几乎无效(Random@K 不升反降)

  • Best-of-K 选择策略有效,但提升有限(30.62% at K=16)

  • Pass@K 上限达 51.67%,表明正确答案经常"存在"于采样中,但选不出来

这意味着 Reinforcement Learning 和更好的 Reward Model 是突破瓶颈的关键方向。

九、与现有 Benchmark 的对比

Benchmark

Visual Ops.

Visual Search

Text Search

Code Exec.

Multi-Image

Avg Turns

TIR-Bench

2.92

Agent-X

3.4

MMSearch-Plus

4.6

BrowseComp-VL

4.3

VisualToolBench

4.46

AgentVista (Ours) 12.67

AgentVista 是唯一同时覆盖全部四类工具且支持多图输入的 Benchmark,平均工具调用轮次达 12.67 轮,远超现有工作,真实反映了长链条多模态推理的挑战。

十、总结与展望

AgentVista 揭示了当前多模态 Agent 面临的核心挑战:

  • 细粒度视觉理解仍然是最大瓶颈,一个感知错误就会引发连锁失败

  • 长链条工具调用(平均 12+ 轮、困难样本 25+ 轮)远超模型当前的规划和执行能力

  • 领域泛化性不足,没有任何模型能在所有领域保持一致的高水平

  • Test-Time Scaling 有潜力但选择策略是关键,RL 方向值得深入探索

我们的 Benchmark 和轻量级 Agent 框架已开源,欢迎社区使用和贡献:

  • 项目主页: https://agentvista-bench.github.io/

  • GitHub: https://github.com/hkust-nlp/AgentVista

  • 论文: https://arxiv.org/abs/2602.23166

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐