警告:你的Agent可能无法“解决“真实世界的视觉问题

当我们让最强 AI 看真实照片解决实际问题,最强大模型集体翻车 —— AgentVista: 超高难度多模态 Agent 评测
我们提出了 AgentVista —— 一个面向真实视觉场景的超高难度多模态 Agent 评测基准。209 道精心策划的任务横跨 7 大领域 25 个子方向,要求模型在复杂视觉线索中完成多步工具调用与推理。结果令人震惊:即便是当前最强的 Gemini-3-Pro,整体准确率也仅有27.27%。
论文标题: AgentVista: Evaluating Multimodal Agents in Ultra-Challenging Realistic Visual Scenarios
机构: 香港科技大学 (HKUST), 浙江大学, 新加坡国立大学, 北卡罗来纳大学教堂山分校
论文链接: https://arxiv.org/abs/2602.23166
项目主页: https://agentvista-bench.github.io/
GitHub: https://github.com/hkust-nlp/AgentVista
一、为什么我们需要 AgentVista?
人类天生就能无缝整合多感官信息来解决复杂的现实问题。随着 GPT-5、Gemini-3、Claude-Opus-4 等多模态大模型的快速演进,构建具有视觉智能体能力(Visual Agentic Intelligence)的 AI Agent 成为了前沿研究的核心方向。我们期待这些 Agent 能够真正"看懂世界并采取行动"——在超市货架前扫描商品标签并结合营养信息满足用户的健康约束,在设备故障时将故障照片与电路原理图关联起来精准定位问题,在装修时跨越多张实景照片匹配地板样式、检索产品规格并计算最终费用。
然而,一个关键问题浮出水面:
现有的 Benchmark 真的能衡量 Agent 在真实场景中的能力吗?
答案是:远远不够。我们系统分析了当前主流多模态 Agent 评测,发现它们存在两大核心缺陷:
缺陷一:Capability-Specific Evaluation(能力碎片化评测)。现有 Benchmark 往往只聚焦于某一项特定能力——有的只测视觉操作(如裁剪、缩放),有的只测网页浏览,有的只测代码生成。这种"单项考试"模式根本无法评估一个通用型 Agent 在长链条工作流中协调多种技能的真实能力。
缺陷二:Realism 与 Difficulty 之间的失衡。真实的 Agent 任务之所以困难,是因为它们同时面临杂乱的视觉证据和长链条的受约束工具调用。然而很多 Benchmark 为了增加难度,反而简化了视觉输入或采用了偏离日常工作流的工具模式。例如,VisualToolBench 会对输入图像进行预处理以适配特定视觉操作——虽然这有利于评测视觉操作能力,但也将问题从"在自然视觉状态下推理"转变成了"在精心策划的输入上操作",偏离了真实场景的挑战。
为此,我们提出了 AgentVista —— 一个以真实视觉场景为核心,要求自然交错的混合工具调用(Interleaved Hybrid Tool Use),同时保证答案可验证的超高难度多模态 Agent 评测基准。AgentVista 包含 209 道任务,横跨 7 大领域 25 个子方向,每一道任务都扎根于细节丰富的真实视觉状态(日常照片、截图、技术图纸),要求 Agent 反复锚定视觉线索、检索外部信息并验证中间决策——这正是现实世界中多模态智能体面临的真正挑战。
二、AgentVista 的三大设计原则
1. Vision-Centric:视觉是解题的核心
每一道任务的关键证据都必须从图像中获取。图像是真实拍摄或截图,包含细微但关键的视觉线索——标签上的小字、电路板上的芯片型号、地图中的隐藏路径。文字描述无法替代视觉观察,纯文本搜索无法绕过视觉理解。
2. Interleaved Hybrid Tool Use:自然交错的多工具协作
每道任务至少需要两种以上工具类别的交错调用。例如:先用 Code Interpreter 裁剪放大图像细节,再用 Image Search 反向搜索,接着 Web Search 查询规格参数,最后用代码计算最终答案。这正是真实用户解决问题的自然工作流。
3. Verifiable:答案确定、评测可靠
每道任务都有简洁明确的标准答案(数字、实体名称或简短描述),避免主观评判带来的评测噪声,评测过程如同数学题一样客观稳定。
三、数据构建:从 30 万张候选图到 209 道精品任务
AgentVista 采用了极其严格的 四阶段筛选流程,从超过 30 万张候选图像中层层过滤,最终仅保留 209 道任务——淘汰率高达 99.93%。
四个阶段:
|
阶段 |
内容 |
产出 |
|---|---|---|
| Stage 1: Agent-Centric Filtering |
使用 Claude-Opus-4 进行模型辅助筛选 + 人工审核,过滤视觉信息不足的图片 |
~568 候选(0.19%) |
| Stage 2: Expert Finalization |
专家标注员将任务改写为真实用户请求,确保 vision-centric 且答案确定 |
315 道任务 |
| Stage 3: Execution Filtering |
在工具环境中实际执行验证,保留需要跨工具类别交错调用的任务 |
241 道任务 |
| Stage 4: Two-Round Verification |
两轮人工复核,移除证据不充分、答案不稳定的样本 |
209 道最终任务 |
每道任务的人工构建成本约 4 小时,专家求解时间约 30 分钟。
四、Benchmark 全貌:7 大领域、25 个子方向
AgentVista 覆盖了生活与专业场景中最具代表性的 7 大领域:
|
统计项 |
数值 |
|---|---|
|
总任务数 |
209 |
|
总图片数 |
308 |
|
一级类别 |
7 |
|
二级类别 |
25 |
|
平均 Query 长度 |
401.4 字符 |
|
单图任务 |
151(72.2%) |
|
多图任务 |
58(27.8%) |
七大领域涵盖:Technology(技术)、Commerce(商业)、Geography(地理)、Entertainment(娱乐)、Society(社会生活)、Academics(学术)、Culture(文化)。
下图展示了来自不同领域的采样任务示例:
五、工具环境:四大核心工具
AgentVista 为 Agent 提供了 4 种核心工具,覆盖真实多模态工作流:
|
工具 |
功能 |
典型用途 |
|---|---|---|
| Web Search |
网页搜索 |
查询产品参数、历史事件、技术规格 |
| Image Search |
图像搜索(正向/反向) |
以图搜图、识别物品来源 |
| Visit |
访问网页并提取内容 |
深入阅读搜索结果、获取详细信息 |
| Code Interpreter |
Python 代码执行(PIL, NumPy, OpenCV等) |
图像裁剪/放大、数值计算、数据分析 |
六、核心实验结果:最强模型也只有 27%
我们评测了当前 14 个主流模型,包括 GPT-5 系列、Gemini-3 系列、Claude 系列、Grok-4 以及开源模型。结果揭示了一个残酷的现实:
主实验结果
|
Model |
Comm. |
Geog. |
Ent. |
Tech. |
Soc. |
Acad. |
Cult. |
Overall |
Avg Turns |
|---|---|---|---|---|---|---|---|---|---|
| Gemini-3-Pro |
16.67 |
28.21 | 20.51 |
32.35 |
32.00 |
40.00 | 40.00 | 27.27 |
6.67 |
|
GPT-5 |
23.81 |
23.08 |
12.82 |
35.29 |
28.00 |
26.67 |
26.67 |
24.40 |
12.67 |
|
GPT-5.2 |
21.43 |
17.95 |
20.51 |
38.24 |
24.00 |
33.33 |
20.00 |
24.40 |
13.85 |
|
GPT-5.1 |
23.81 |
12.82 |
15.38 |
26.47 |
24.00 |
40.00 | 40.00 |
22.97 |
17.14 |
|
Gemini-3-Flash |
16.67 |
17.95 |
10.26 |
29.41 |
28.00 |
40.00 |
20.00 |
21.05 |
7.78 |
|
o3 |
21.43 |
15.38 |
7.69 |
23.53 |
40.00 |
26.67 |
13.33 |
20.10 |
13.18 |
|
Claude-Opus-4.1 |
11.90 |
23.08 |
10.26 |
29.41 |
16.00 |
26.67 |
13.33 |
18.18 |
7.28 |
|
Claude-Sonnet-4.5 |
11.90 |
23.08 |
7.69 |
26.47 |
24.00 |
20.00 |
13.33 |
17.70 |
9.99 |
|
Grok-4 |
11.90 |
23.08 |
7.69 |
20.59 |
28.00 |
0.00 |
0.00 |
14.83 |
16.44 |
|
Qwen3-VL-235B |
7.14 |
7.69 |
7.69 |
26.47 |
16.00 |
20.00 |
13.33 |
12.92 |
2.34 |
关键发现
1. 整体难度极高,提升空间巨大
最强的 Gemini-3-Pro 整体准确率仅 27.27%,意味着每 4 道题只能答对 1 道。这与现有 Benchmark 上动辄 80-90% 的成绩形成了鲜明对比,真实揭示了当前多模态 Agent 的能力边界。
2. 没有模型能"通吃"所有领域
-
GPT-5 系列在 Technology 和 Commerce 上领先
-
Gemini-3-Pro 在 Geography、Culture 上表现最佳
-
Claude 系列在需要仔细阅读和约束遵循的任务上更稳健
-
各家模型都有明显的"偏科"现象
3. 多图输入并不一定更难
出乎意料的是,多图任务的表现往往优于单图任务。例如 Gemini-3-Pro 在多图任务上达到 36.84%,远高于单图的 23.68%。这说明多角度视觉证据反而降低了歧义性,真正的瓶颈在于长链条的工具调用和约束追踪。
七、深度分析:模型到底在哪里翻车?
工具使用模式差异显著
-
GPT-5 系列重度依赖 Code Interpreter,尤其是图像裁剪(CROP)操作
-
Gemini 和 Claude 系列更偏好 Web Search 驱动的检索式工作流
-
Image Search 在所有模型中使用频率最低,但对特定任务不可或缺
错误类型分析
最主要的失败原因是 Visual Misidentification(视觉误识别)——占据了所有模型错误的最大比例。模型在细粒度视觉理解上的一个小错误(看错标签、混淆相似元器件、漏掉微小标记),会像多米诺骨牌一样引发后续检索和推理的连锁错误。
第二大错误来源是 Knowledge Hallucination(知识幻觉)——模型编造看似合理但缺乏依据的事实,而非基于图像和检索到的信息进行推理。
工具消融实验
|
设置 |
Gemini-3-Pro |
Claude-Sonnet-4.5 |
|---|---|---|
|
Full Tool(全部工具) |
27.27% | 17.70% |
|
Vision Only(仅视觉工具) |
20.10% |
17.22% |
|
Search Only(仅搜索工具) |
26.32% |
13.40% |
|
No Tool(无工具) |
18.18% |
13.40% |
实验表明,混合工具协作 > 单一工具。有趣的是,Gemini-3-Pro 仅用搜索工具就能接近全工具表现(26.32% vs 27.27%),体现了其强大的视觉感知能力;而 Claude-Sonnet-4.5 在移除搜索后性能大幅下降,更依赖检索辅助。
八、Test-Time Scaling:采样更多次能救命吗?
我们用 Gemini-3-Flash 探索了 Test-Time Scaling 的效果:
|
K(采样次数) |
Random@K |
Best-of-K |
Pass@K |
|---|---|---|---|
|
1 |
21.05 |
21.05 |
21.05 |
|
2 |
19.11 |
24.88 |
26.07 |
|
4 |
18.23 |
26.32 |
34.22 |
|
8 |
17.09 |
28.23 |
42.59 |
|
16 |
18.05 |
30.62 |
51.67 |
-
随机采样几乎无效(Random@K 不升反降)
-
Best-of-K 选择策略有效,但提升有限(30.62% at K=16)
-
Pass@K 上限达 51.67%,表明正确答案经常"存在"于采样中,但选不出来
这意味着 Reinforcement Learning 和更好的 Reward Model 是突破瓶颈的关键方向。
九、与现有 Benchmark 的对比
|
Benchmark |
Visual Ops. |
Visual Search |
Text Search |
Code Exec. |
Multi-Image |
Avg Turns |
|---|---|---|---|---|---|---|
|
TIR-Bench |
✅ |
❌ |
❌ |
✅ |
✅ |
2.92 |
|
Agent-X |
✅ |
❌ |
✅ |
✅ |
✅ |
3.4 |
|
MMSearch-Plus |
❌ |
✅ |
✅ |
❌ |
✅ |
4.6 |
|
BrowseComp-VL |
❌ |
✅ |
✅ |
✅ |
❌ |
4.3 |
|
VisualToolBench |
✅ |
❌ |
✅ |
✅ |
❌ |
4.46 |
| AgentVista (Ours) | ✅ | ✅ | ✅ | ✅ | ✅ | 12.67 |
AgentVista 是唯一同时覆盖全部四类工具且支持多图输入的 Benchmark,平均工具调用轮次达 12.67 轮,远超现有工作,真实反映了长链条多模态推理的挑战。
十、总结与展望
AgentVista 揭示了当前多模态 Agent 面临的核心挑战:
-
细粒度视觉理解仍然是最大瓶颈,一个感知错误就会引发连锁失败
-
长链条工具调用(平均 12+ 轮、困难样本 25+ 轮)远超模型当前的规划和执行能力
-
领域泛化性不足,没有任何模型能在所有领域保持一致的高水平
-
Test-Time Scaling 有潜力但选择策略是关键,RL 方向值得深入探索
我们的 Benchmark 和轻量级 Agent 框架已开源,欢迎社区使用和贡献:
-
项目主页: https://agentvista-bench.github.io/
-
GitHub: https://github.com/hkust-nlp/AgentVista
-
论文: https://arxiv.org/abs/2602.23166


更多推荐



所有评论(0)