点击蓝字

关注我们

AI TIME欢迎每一位AI爱好者的加入!

大模型 Agent 真的准备好接手复杂的真实数据分析了吗?中山大学陈川课题组联合南方周末科创力研究中心,共同发布了DataClawBench 评测基准。该基准引入 492 个智库咨询真实任务,对前沿大模型展开过程级评测,为该问题提供量化分析依据。

作者:DataClaw 团队

单位:中山大学× 南方周末科创力研究中心

Leaderboard:https://github.com/GTML-LAB-sysu/DataClaw

Huggingface:https://huggingface.co/datasets/GTML-LAB/DataClaw

GitHub:https://github.com/GTML-LAB-sysu/DataClaw

ArXiv:https://arxiv.org/abs/2605.02503

研究背景:从 demo 到落地,一直存在但未被显式讨论的探索负担

过去一年,端到端数据分析 Agent 的演示视频几乎每周都在刷屏。 从 Manus 到 OpenClaw,输入一句"帮我分析一下 2022 年新能源汽车产业的省级竞争格局",几分钟后就能拿到一份结构化的报告。但凡真在企业、券商、咨询机构里写过内部数据分析报告的人都明白,真实的数据分析,从来不是"读一段表、出几个相关的数"。它本质上是一个准确度要求很高的开放式工作流:

分析师拿到一个具体问题 →先在一片未知的数据环境里"摸"出与问题相关的数据 → 再做清洗、对齐、跨表 join、聚合、计算 → 多方验证最后才能得出一个可以交付的准确结论。

这其中第一步"在开放式的环境里感知所需数据"往往才是最耗时、最容易出错的一步。等到这一步走通了,后面的处理才有意义。

然而,真实开放式数据环境的一个重要特征是未知且嘈杂:表里有什么字段、字段是什么口径、企业名称是不是统一、单位有没有错位,表格有哪些数据,表格与表格的关系是什么。这些先验引导信息很多时候并不完整或者难以简单获得。因此,在真实的复杂任务下,大家又往往不放心将具有唯一正确答案的严谨分析任务交给 Agent 从头处理。表现与端到端Agent的自主性目标存在较大差距。

开源DataClawBench认为,这些缺失的数据先验引导带来的探索负担正是真实数据分析任务区别于实验室demo的关键。要让评测分数真正能预测现实部署表现,Benchmark 就必须把数据负担原样保留下来,否则跑出来的高分很容易在落地时打回原形。事实上,目前主流的数据分析 Benchmark 大多在不同程度上简化或限定了数据环境:要么预先指定数据源、要么提供完整 schema、要么预清洗数据。它们各有评测目标,但都不是为真实、混乱、未探索的数据环境而设计的。

DataClawBench 回答的是一个非常具体的实际问题:当一个 LLM Agent 被丢进真实金融数据分析场景里,数据没有被预先清洗、所需数据源也没有被指定,它在复杂数据分析任务上的效用和效率表现如何?DataClaw深入剖析LLM agent全推理过程,给出了一份初步探索答案。

数据集概览:基于真实金融智库场景构建的复杂多步推理任务

DataClawBench由中山大学计算机学院课题组主导构建,其底层数据与任务来自南方周末科创力研究中心多年的智库研究与咨询业务,并由中山大学岭南学院的金融与产业研究专家进行专业命题与标注。每一道题不是为评测而造,而是研究咨询机构真实在桌子上做的任务。

典型的任务长这样

企业-行业分析(中等难度):2022 年富途控股的人均净利润,是中国资本市场服务业人均净利润中位数的多少倍?

企业-产业-政策联动(中等难度):比较"A 公司所在产业的中央级科技政策数量"与"B 公司所在产业的地方级政策数量"。

综合决策(困难难度):2022 年某汽车制造企业要在多省中选址新建工厂,按给定的"产业配套综合指数"打分规则(涉及7 个子项、不同权重、归一化方法),算出综合指数最高省份的指数值。

风险评估(困难难度):如果国家全部 R&D 税收优惠取消,制造业中哪三个细分行业的平均净利润率下滑最大?

DataClawBench总共包含492 个任务,分为3个任务难度,131 easy / 286 medium / 75 hard。创新性地,与现有大多数数据分析Benchmark不同,DataClaw包含过程评估标注。过程评估将评估从答案对不对提升到了关键逻辑链条在哪里断了的诊断层面。为同时满足结果导向评估和过程导向评估,所有任务存在3个主要标签:1. 唯一客观答案; 2. 关键里程碑,即专家认为必须经过的中间证据点; 3. 参考轨迹,即专家亲自走出来的参考推理路径。

真正用于评测的数据环境,由"未经清洗"的真实业务数据构建而成,横跨企业、产业和政策三个大的主题域。详细分布如下图。Agent 拿到的是一个统一原始仓库,需要自己去探索。

评估指标:同时考虑最终结果和推理过程的评估方式

DataClawBench 在评测层面做了一件目前业内 99% 的数据分析 Benchmark 都没做的事,同时分析了最终结果和推理过程。DataClawBench 总共包含4个评价指标,通过这套指标,即使 Agent 没答对,DataClawBench 仍能告诉你它探到了哪一步、是什么时候探到的,断裂点的原因是什么。

实验结果

DataClawBench在 OpenClaw 统一框架下,用 Docker 容器隔离评测了 8 款当下最受关注的 LLM Agent,单任务超时设置为1200 秒:

问题 1:当 Agent 必须自己寻找相关数据时,它们还能保持可靠吗?

不可靠。 表 4 汇总了全部 492 个任务上的最终结果准确率。即使是最强的 Agent —— Claude Opus 4.6,也只达到了 63.4%的整体准确率。其他 7 个模型均低于 50%。没有任何模型接近饱和,这表明在真实数据环境下进行探索式分析这一问题远未被解决。此外,性能下滑在难度维度上也是非均匀的。中等难度到困难难度是一个明显的断崖下降。

问题 2:更长的探索是否真的能转化为有用的进展?

仅部分如此。 在答错的任务上,探索得更久确实与更高的 GPR 相关,因此额外的请求并未完全浪费。如下图 所示, GPT-5.4、Kimi-K2.5、GLM-5在失败任务上仅使用约 12–19 次请求,GPR 大约在 18–20%。相比之下,Gemini 3.1 Pro、Minimax M2.7、DeepSeek-V3.2 和 Qwen3.5-Plus 探索得更久,使用约 32–42 次请求,获得更高的 GPR,大约在 22–34%。这说明额外的探索确实可以挽回部分中间进展

但是,从请求数到进展的转化效率高度不均。Claude 用相对较少的失败任务请求数就达到了最高的 GPR,而 Gemini 与Minimax 等模型花了远更多的请求却只换来更低的进展。这表明探索长度并不是有用进展的好代理

问题 3:同一个错误答案背后,可能隐藏着什么样的失败模式?

同一个错误答案可能隐藏着完全不同的过程失败模式。 最终准确率只告诉我们答案是否正确,并不能展示 Agent 是如何失败的。Acc 排名与 GPR 排名之间的差距清晰地揭示了这一点。表 5 显示,在 Hard 任务上,Gemini 3.1 Pro 的 Acc 排名第6,但 GPR 排到第 2。这意味着它的许多失败 run 仍然达成了有用的中间里程碑。Kimi-K2.5 则呈现出相反的模式:Acc 排第 4,但 GPR 排末位,这意味着它在失败时往往连关键证据都没摸到。从结果视角看,这两个 Agent 似乎差不多;从过程视角看,它们根本是两种不同的 Agent。自然引出第四个问题。

问题 4:当 Agent 失败时,它们呈现出怎样的探索画像?

DataClawBench 发现 8 款模型也有各自的探索画像,用 Acc × GPR × TPE 三轴交叉,可以清晰地分成 4 类:

  • 决断派:Claude Opus 4.6。证据找到得多、找到得早,满足大家对LLM优秀的期待。

  • 磨叽坚持派:Gemini 3.1 Pro 和 Minimax M2.7。里程碑找得到,但都找到得很晚,不高效。

  • 乱试派:DeepSeek-V3.2 和 Qwen3.5-Plus。步数花得不少,找到的证据进度跟不上。投入与收入相较于上面两个类型不成正比。

  • 躺平派:GPT-5.4、 Kimi-K2.5 和 GLM-5。早早收工,效率看上去高,但其实是因为根本就没怎么探索。相对容易找到就找,没那么容易还是早早放弃躺平算了。

为进一步失败归因,继续回答了3个问题:

问题 5:探索式数据分析的难点究竟来自哪里:数据噪声还是缺失的引导?

两者都重要。 我们在 30 个原本失败的任务上,对 Qwen3.5-Plus 进行了三种环境不确定性逐级递减的复测,如下图所示:

第一种是原始的真实环境;第二种移除了数据噪声与无关数据源;第三种在第二种基础上进一步提供完整的 schema 引导

降低环境不确定性确实能提升准确率,但收益在不同难度上并不均匀原始环境下,模型在所有采样任务上全部失败移除噪声与无关数据源后,Easy 准确率恢复到 20%,Medium 恢复到 33.3%,但 Hard 仍0%进一步加入完整 schema 引导后,Easy 上升至 40%,Medium 上升至 45%,Hard 才上升至 20%

这说明探索式数据分析并不只是因为数据嘈杂才困难。移除噪声与无关数据源有助于 Agent 进入一个更有用的证据空间,在 Easy 与 Medium 任务上尤其明显。但 Hard 任务在没有更强的 schema 引导前仍然棘手,即便加上引导也只能部分恢复。这表明 Agent 同时在多重不确定性下挣扎:嘈杂的证据、无关的数据源、与不完整的 schema 理解。

问题 6:Agent 最早在哪里丢失分析线索?

Agent 通常很早就丢失分析线索,但更强的 Agent 比更弱的 Agent 失手得更晚。 我们通过记录每次失败 run 中首个未达成的 gold 里程碑 mₖ 来定位失败起点。下图按难度分别报告了全部 8 款 Agent 的分布。

强模型 Claude Opus 4.6 较少在第一个里程碑上就崩盘。大多数其他 Agent 失手得早得多:

  • 在 Easy 任务上,它们的 M₁ 失败占比通常超过 80%,GPT-5.4 高达 95.0%

  • 在 Medium 与 Hard 任务上,许多 Agent 仍有超过一半的失败 run 仅卡在 M₁。

这一对比表明,早期脱轨是一种常见的失败模式,但其严重程度取决于模型能力。强模型往往能跨过初始的证据获取阶段后才失手;而多数模型几乎立刻就丢失分析线索——还在找证据、搭建问题框架、或设置中间变量的时候就掉队了。

问题 7:是什么让 Agent 丢失分析线索?

Agent 是"放弃"还是"硬交一个错答案",取决于断点处的操作类型。 表 6 按"首个未达成里程碑的操作类型"与"最终终止方式"对失败 run 做了交叉分析

对于 实体属性查找(Entity Attribute Lookup),占比最高的终止方式是 Voluntary Give-up 达到 45.7%。这表明 Agent 通常能识别具体证据(如某一行、某个字段、某个实体)的缺失。相反,Wrong-Answer Stop主导了那些即便证据不全也仍能产出貌似合理输出的操作,例如:聚合计数/求和 达 69.0%、政策检索与计数 达 66.0%、比较 / 布尔判断 达 63.1%、排序与选择统计汇总 也都超过 56%。这些操作很少能给出干净的"无结果"信号。因此,Agent 丢失分析线索,不仅因为它执行了错误的操作,还因为它在操作失败后选择了错误的停止方式。

总结

DataClawBench是一个用于Agent 在未充分探索的真实数据环境下完成金融数据分析任务的基准。它隐藏了数据源与schema 先验、保留了原生数据噪声,并为任务提供了过程级标签。DataClawBench 不仅揭示 Agent是否成功,更揭示它如何失败、在哪里失败。实验表明,前沿 LLM 在 DataClawBench 上仍然吃力。总体而言,DataClawBench 为探测自主金融数据分析 Agent 的能力边界提供了一个诊断性测试平台。

往期精彩文章推荐


 关于AI TIME 

AI TIME源起于2019年,旨在发扬科学思辨精神,邀请各界人士对人工智能理论、算法和场景应用的本质问题进行探索,加强思想碰撞,链接全球AI学者、行业专家和爱好者,希望以辩论的形式,探讨人工智能和人类未来之间的矛盾,探索人工智能领域的未来。

迄今为止,AI TIME已经邀请了2000多位海内外讲者,举办了逾800场活动,超1000万人次观看。

我知道你

在看

提出观点,表达想法,欢迎

留言

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐