【VLM-Agent】MTA-Agent: Multimodal Deep Search Agents
note
- 自动数据生成流水线:基于现有VQA数据集,用ReAct循环+文搜/识图等4工具,自动构造2–4跳图文样本,多层校验去脏,产出21K数据集MTA-Vision-DeepSearch。
- 训出来的 MTA-DeepSearch Agent 在 ReAct 循环里能用的变成 7 个:Web text search、Web image search(文→图描述)、Web URL reader、Reverse image search(Google Lens)、OCR(抽图上所有可见文字)、Python/IPython 执行(算数、数据处理)
- Tool Replay Cache:把数据合成期的工具入参(query||question、url||question、image_url||query||question 等)和出参存成静态字典,训练时余弦相似度 >0.75 直接命中缓存,不花真实 API 钱。表 4 显示 replay 训 8B 平均 46.34%,比“真工具调 FVQA+News”的 44.06% 还高,更逼近全量真工具 48.66%。
文章目录
一、研究动机
MTA-Agent: Multimodal Deep Search Agents
Salesforce AI Research
本质不是“又做一个多模态 Agent demo”,而是把多模态深搜 Agent 的训练供给问题一次性补齐:从现有 VQA 自动合成 2.1 万条多跳、可验证、带工具轨迹的数据,再用 RL 把开源 32B 模型训到超过同工具设置下的 GPT-5 / Gemini-2.5-Pro,追平 Gemini-3-Pro。
作者开篇就点明:MLLM 看图答题已经很强,但一旦问题变成“图里看到 X → X 关联到 Y → Y 的外部知识指向 Z”这种多跳、需实时检索、需图文混合取证的任务,开源模型会迅速退化。根本原因是三道坎:
- 主干推理深度不够:未训练的 Qwen3-VL-32B 在 MMSearch-VL 上平均只用 1.76 次工具调用,而 GPT-5 用 2.60 次、精度 77.65% vs 68.52%。模型不会“持续搜”,只会浅尝辄止。
- 高质量多跳深搜数据几乎为零:已有合成数据常出现“推理链和最终答案不一致”、答案不唯一、靠单图+一次网页搜索走捷径,无法教出长程搜索行为。
- 数据同质化:大多来自单图+文本检索,缺 OCR/反搜/多源交叉验证,Agent 容易过拟合成“只会一种搜法”。
论文的核心判断:多模态深搜的能力天花板,短期由“训练轨迹质量”决定,而不是由基座参数规模单独决定。 所以 MTA-Agent 的主产品是“开源 recipe + 21K 数据 + 回放缓存”,模型权重反而是副产品。
二、MTA-Agent 数据工厂 + Replay RL
2.1 种子筛选(§3.1)

从 FVQA / LiveVQA-News / InfoVQA / InfoSeek / OK-VQA 抽种子,过五道闸:
- GPT-5-mini 判“是否真需图才能答”
- GPT-5 改写干净自由问句 + 抽实体答案
- 答案必须是10 类专有实体(人/组织/地点/产品/事件/作品/科技/医学/商业/天文),拒掉数字、形容词、多实体
- GPT-5-mini 二次验实体合法性
- GPT-5(视觉+联网)验答案图文事实一致
2.2 QA Agent 多跳合成(§3.2)
ReAct 式循环,配 4 个工具:Web Search / Web Reader / Google Lens 反搜 / Image Search。
- 从种子图答出第 1 跳实体 a₁
- 以 a₁ 为桥,检索网页→抽候选 (q₂, a₂, 上下文)
- 单跳生成四步:摘要 → 抽 QA(强约束:问句含 aₖ₋₁、答案唯一不重样、去掉 aₖ₋₁ 则不可答)→ 简化问句 → GPT-5+联网五维验证(事实/含实体/唯一/时间稳定/实体依赖)
- 难度筛选:用 Qwen3-VL-32B 弱模型对合并问句猜查询,和实际检索查询算 Jaccard,选相似度最低的候选(<0.6),强迫题目不是“弱模型一眼搜到”的假多跳
- 防泄露:合并后用 Tavily 直接搜合并问句,能直接出答案就丢弃
- 消歧:短实体(Apple)自动补 “Apple, a technology company” 作为下一跳搜索 seed,但标签仍用原短答案
- 叠到 2/3/4 跳,每条链保留所有中间 QA 对
最终产出 MTA-Vision-DeepSearch:21,155 条训练样本(2-hop 4431 / 3-hop 4417 / 4-hop 3851),人工抽 444 条三审:97.7% 易懂、89.4% 单跳事实对、76.3% 真需图。
2.3 训练范式(§4.1.4 + §5.3)
- 基座:Qwen3-VL-32B / 8B-Instruct
- RL:DAPO,batch 64、每 prompt 8 rollout、lr 2e-6、100 step,ReAct 最多 6 步,observation token 掩掉不算梯度
- 奖励:GPT-5 当 judge,比 boxed 答案语义等价 + 推理中是否出现过 gt
- 关键工程贡献——Tool Replay Cache:把数据合成期的工具入参(query||question、url||question、image_url||query||question 等)和出参存成静态字典,训练时余弦相似度 >0.75 直接命中缓存,不花真实 API 钱。表 4 显示 replay 训 8B 平均 46.34%,比“真工具调 FVQA+News”的 44.06% 还高,更逼近全量真工具 48.66%。
三、实验结果(§4.2,同工具设置下)

6 基准:MMSearch / MMSearch-Plus / BrowseComp-VL / HR-MMSearch / FVQA / MTA-test
| 模型(Agent 工作流) | 平均 |
|---|---|
| GPT-5 | 51.86 |
| Gemini-2.5-Pro | 50.98 |
| Gemini-3-Pro(疑似含 MMSearch 污染) | 54.46 |
| Qwen3-VL-32B-Instruct(未训) | 40.85 |
| MTA-DeepSearch-8B | 48.66 (+12.08) |
| MTA-DeepSearch-32B | 54.63 (+13.78) |
32B 版在 MMSearch 上 82.35%(超 GPT-5 的 77.65%),HR-MMSearch 53.95%、BC-VL 53.77%,平均反超 GPT-5 达 2.78 点、超 Gemini-2.5-Pro 3.65 点,与 Gemini-3-Pro 持平。8B 也比未训同基座高 12 点,说明数据可跨尺度迁移。
行为层面变化(§5.2)
- 搜索深度:平均步数 2.27 → 4.28,6 步触顶占比 32%,分布从“左偏浅”变“右偏深”
- 工具结构化:Web Search 使用率 72%→99%,Reverse Image Search 55%→79%,形成“先文搜定位实体→反搜视觉落地”的两段式;OCR 从高位降到 16%,说明模型学会“能网上查就不抠图”
- 表 3 消融:只用 FVQA+News 平均 45.23%;加 4-hop 单独训仅 45.35%(太难);2/3/4-hop 混训 46.24%;全种子+全跳数 49.52%(8B 设定),证明“种子多样性 + 跳数阶梯”缺一不可
四、分析与可复现性价值
- 数据验证不是装饰:C.1 提到初版 14% 图像冗余(合并后不看图也能答)、15% 实体歧义(Newark CA/NJ)、12% 上下文依赖(“上文提到…”),三轮 prompt+验证后分别压到 6% / 3% / 2%——这些才是 89.4% 单跳事实率的来源。
- Replay 训练成立这件事比“超 GPT-5”更实用:意味着后续开源社区不用烧 Tavily/Google Lens 额度,拿它释出的 rollout 历史就能复训别的小模型。
- 完全开放:dataset / trajectories / DAPO 配置 / cache 构建脚本全在
SalesforceAIResearch/MTA-Agent,是目前多模态深搜少见的“非玩具级”开源配方。
顺带一提,同期 OpenSearch-VL、SearchEyes 也走向“Wikipedia 路径采样 / KG 模拟搜索世界 + 步级 credit assignment”路线,MTA-Agent 的差异化在于完全基于真实 VQA 种子 + 真实工具闭环 + 真实网页验证,不依赖 KG 模拟环境,因此对“现实网页噪声”更鲁棒,但跳数控制在 4 以内、不自带视觉增强工具(crop/sharpen)是其下一步可被挑刺的点。
更多推荐



所有评论(0)