打破 web agent 性能天花板!腾讯 Exp2Evo 范式助力模型攻克复杂信息合成难题
摘要:深度研究型网络智能体不仅要从网络环境、文件和多模态输入等不同来源检索信息,更重要的是,它们需要严谨地分析和聚合知识,以便生成高质量、富有洞察力的研究成果。然而,现有的开源深度研究智能体系统主要侧重于增强网络智能体寻找特定信息的能力,却忽视了信息聚合这一基本需求,这限制了它们生成连贯见解或支持深入研究的能力。基于一个开源的智能体框架SmolAgents,我们收集了监督微调轨迹,以开发一系列名为WebAggregator的基础模型。WebAggregator-8B的性能与GPT-4.1相当,而32B版本在GAIA-text上的表现超过了GPT-4.1超过10%,并且接近Claude-3.7-sonnet的性能。此外,鉴于评估网络智能体信息聚合能力的基准测试的有限可用性,我们构建了WebAggregatorQA的人工标注评估分割作为一个具有挑战性的测试集。在这个基准测试中,Claude-3.7-sonnet仅达到了28%,而GPT-4.1的得分为25.8%。即使智能体设法检索到个别参考资料,它们在WebAggregatorQA上仍然面临困难,这突显了加强网络智能体基础的信息聚合能力的必要性。
标题: "Explore to Evolve: Scaling Evolved Aggregation Logic via Proactive Online Exploration for Deep Research Agents"
作者: "Rui Wang, Ce Zhang, Jun-Yu Ma"
文章链接: "https://www.arxiv.org/pdf/2510.14438"
关键词: ["WebAggregator", "信息聚合", "深度研究智能体", "数据集构建", "强化学习", "自然语言处理", "人工智能"]
研究背景:AI的"信息聚合"能力危机
当我们谈论AI的信息处理能力时,大多数研究都聚焦于**“找到信息”(信息检索/IS),而忽略了更关键的"整合信息"**(信息聚合/IA)能力。现有数据集如GAIA、BrowseComp和WebWalker虽然在信息检索任务上表现出色,但它们普遍缺乏对多源信息的深度整合需求。

如表1所示,在我们提出WebAggregatorQA之前,没有任何一个数据集能够同时支持信息检索和信息聚合。GAIA虽然同时支持IS和IA,但缺乏训练数据;而其他数据集如WebShaper、TaskCraft等则完全不支持IA能力的训练。这种缺陷导致现有AI模型在面对需要综合分析多个来源信息的复杂任务时往往表现不佳。
举个具体例子,当被问及"2010-2022年间,所有陆地面积超过200万平方公里的国家中,哪个国家的GDP年增长率最高?其2022年人均GDP是多少?"这样的问题时,传统AI模型往往能够找到各个国家的GDP数据(信息检索),但在计算增长率、筛选符合条件的国家、最终确定答案(信息聚合)的环节却频频出错。
方法总览:Explore to Evolve范式如何革新数据构建
为了解决这一核心挑战,我们提出了Explore to Evolve(探索-进化)数据构建范式,这是一个完全自动化的流程,能够生成同时考验信息检索和聚合能力的高质量训练数据。

这个创新范式包含两个关键阶段:
1. Proactive Online Exploring(主动在线探索)
不同于传统数据集依赖静态网页或人工标注,我们的方法使用智能体实时探索真实网络,通过以下工具收集多样化信息:
- 搜索引擎(Search)
- 静态页面解析(Visit)
- 动态交互(Click、Input)
- 文件处理(FileRead)
- 图像理解(ImageCaption)
智能体从一个初始URL出发,至少访问7个不同网站,收集涵盖文本、图像、文件等多种类型的信息,确保数据的真实性和多样性。
2. Automatic Aggregation Logic Synthesis(自动聚合逻辑合成)
在收集到原始信息后,智能体并非简单地提出问题,而是自动生成复杂的聚合逻辑,从12种高层操作类型中选择、组合和优化操作,生成可验证的问答对。这些操作类型包括:
- Element Operations:元素级操作(如检索、数学计算)
- Set Operations:集合级操作(如筛选、交集、排序)
- Temporal Reasoning:时间推理(如时间间隔计算)
- Scientific Analysis:科学分析(如统计分析、相关性计算)
这种从高层指导到具体操作的进化过程,使我们能够规模化生产高质量数据。
关键结论:三大突破性发现
通过对WebAggregatorQA数据集和WebAggregator模型的深入研究,我们得出了三个关键结论:
1. WebAggregatorQA:首个同时支持IS和IA的综合数据集
WebAggregatorQA包含9,883个任务(200个保留用于测试),覆盖54,064个独特URL和12个领域,成为目前最全面的Web智能体评估基准。

从领域分布来看,体育(22.3%)、金融(13.4%)和游戏(11.7%)是数据量最大的三个领域。任务构建平均需要调用3-4种不同工具和15个步骤,确保了足够的复杂性。
2. WebAggregator模型:小参数模型实现性能超越
基于开源SmolAgents框架,我们训练了一系列WebAggregator模型。令人惊讶的是,8B参数的WebAggregator模型性能已与GPT-4.1相当,而32B版本则显著超越。

在GAIA-text测试集上,WebAggregator-32B的平均Pass@1性能达到56.3%,超过GPT-4.1的43.7%;在更具挑战性的WebAggregatorQA测试集上,WebAggregator-32B的表现(26.4%)也优于GPT-4.1(25.8%)。
3. 信息聚合:当前AI的共同短板
即使是最先进的AI模型,在信息聚合任务上也表现不佳。Claude-3.7-sonnet在WebAggregatorQA上的准确率仅为28.3%,GPT-4.1为25.8%。更值得注意的是,即使模型成功检索到所有参考URL,仍有30-40%的任务会因聚合能力不足而失败。
深度拆解:WebAggregatorQA数据集的五大特色
1. 多样化的信息来源
WebAggregatorQA的信息来源极为丰富,包括:
- 网页文本解析(Web Text Parsing)
- 动态网页元素交互(Web Element Interaction)
- 图像标题(Image Caption)
- 文件处理(File Processing)
其中,网页文本解析占比最高(约90%),文件处理占比最低(约10%),反映了真实世界中信息获取的分布情况。
2. 复杂的聚合操作
通过对生成的任务进行分析,我们发现智能体进化出了丰富多样的聚合操作。

词云图显示,最常见的聚合操作包括:
- 集合操作(如"intersection"交集、"filter"筛选)
- 数值计算(如"average"平均、"sum"求和)
- 时间分析(如"interval"间隔、"date"日期)
- 科学分析(如"calculation"计算、"deviation"偏差)
3. 与现有数据集的显著差异
为了直观展示WebAggregatorQA的独特性,我们对比了它与现有数据集的任务复杂度。

可以看到,TaskCraft、WebDancer等数据集的任务主要涉及简单的元素检索和集合筛选,而WebAggregatorQA的任务则需要多步骤的复杂聚合,如统计分析、相关性计算等。
4. 全面的聚合操作类型
WebAggregatorQA定义了四大类共12种聚合操作,每种操作都有具体的任务示例。

例如:
- Element Operations:“在《Amor: A Recipe for Building Adaptable …》中,聘请的NLP专家的时薪(以美元计)是多少?”
- Set Operations:“2012年伦敦夏季奥运会上获得至少15枚金牌的国家中,2022年人均GDP(以美元计)排名第三的国家的人类发展指数(HDI)是多少?”
- Temporal Reasoning:“在1990年至2022年之间,哪个国家的名义GDP年均百分比增幅排名第三?”
- Scientific Analysis:“2012年至2022年NBA赛季中,达米安·利拉德的赛季场均得分与波特兰开拓者队常规赛胜率之间的皮尔逊相关系数是多少?”
5. 严格的质量控制
为确保数据质量,我们实施了多阶段质量控制流程:
- 自精炼工具:使用检查清单验证和修改问题
- 数据检查智能体:彻底审查所有参考URL,确保问题、答案和来源的一致性
- 多样性约束:平衡领域和聚合操作的分布
- 数据泄露避免:创建网站关键词黑名单,防止数据污染
最终,约11.72%的数据因未达标而被过滤掉,确保了数据集的高质量。
实验结果:WebAggregator模型性能深度解析
我们在两个基准测试集上评估了WebAggregator模型的性能:GAIA-text(103个纯文本案例)和WebAggregatorQA(159个测试样本)。
与现有模型的对比

从表中可以得出以下关键发现:
-
非智能体模型表现最差:GPT-4.1、Claude-3.7-sonnet等模型在非智能体模式(不使用工具)下表现最差,平均准确率仅为5.6%-11.7%。
-
零样本智能体有显著提升:当启用工具成为零样本智能体后,所有模型的性能都有大幅提升。GPT-4.1的准确率从11.7%提升到43.7%,Claude-3.7-sonnet从22.3%提升到60.2%。
-
WebAggregator模型表现最佳:在微调基础模型中,WebAggregator系列表现最为出色。特别是WebAggregator-32B-pass@3版本,在GAIA-text上达到69.9%的准确率,在WebAggregatorQA上达到35.2%的准确率,显著超越其他模型。
不同难度级别的表现
WebAggregatorQA测试集按难度分为三个级别:Level 1(简单)、Level 2(中等)、Level 3(困难)。我们发现:
- 在Level 1任务上,WebAggregator-32B的准确率达到66.7%,与Claude-3.7-sonnet相当
- 在Level 2任务上,WebAggregator-32B(35.4%)显著超越GPT-4.1(22.2%)
- 在Level 3任务上,所有模型表现都较差,最高的WebAggregator-32B也仅达到13.9%,反映了复杂任务对当前AI的巨大挑战
工具使用和信息聚合分析
通过分析模型的工具使用模式,我们发现:

-
工具使用密度:WebAggregatorQA任务需要更多的推理步骤(平均15步),但工具调用密度较低,表明模型更多依赖内部推理而非外部工具调用。
-
信息聚合失败模式:我们发现了一个关键的失败模式——即使模型成功访问了所有参考URL,仍可能因信息聚合能力不足而失败。
| 模型 | 成功检索但聚合失败次数 | 准确率 |
|---|---|---|
| GPT-4.1 | 30 | 33.3% |
| Claude | 38 | 42.1% |
| WebAgg-32B | 28 | 35.7% |
这一发现揭示了当前AI在信息聚合方面的普遍短板,也凸显了WebAggregatorQA作为评估基准的重要价值。
未来工作:迈向真正的深度研究智能体
WebAggregatorQA和WebAggregator模型的成功为未来的研究指明了几个重要方向:
1. 扩展更多领域和语言
目前WebAggregatorQA涵盖12个领域,但仍有许多专业领域(如法律、工程)尚未覆盖。未来计划将领域扩展到20个以上,并支持多语言,特别是低资源语言。
2. 提升复杂推理能力
Level 3任务的低准确率表明,当前模型在处理高度复杂的聚合逻辑时仍有很大提升空间。未来将研究更先进的聚合策略和推理机制。
3. 增强多模态理解能力
现有模型在处理图像、音频等非文本信息时表现不佳。未来将重点提升模型的多模态理解能力,特别是在科学图表解析方面。
4. 构建更具挑战性的基准
随着模型能力的提升,需要不断更新和增强评估基准的难度。计划每年发布WebAggregatorQA的更新版本,确保其作为最具挑战性的Web智能体评估基准的地位。
更多推荐


所有评论(0)