论文

DataClaw:用于探索性现实世界数据分析的面向流程的代理基准

DataClaw: A Process-Oriented Agent Benchmark for Exploratory Real-World Data Analysis

智能体系统Agent任务评测

摘要

评估自主数据分析代理需要测试它们在未充分探索的数据环境中执行探索性分析的能力。然而,许多现有基准强调先验指导数据设置中的最终答案准确性,并为推理过程评估提供有限的支持。我们推出 DataClaw,这是一个面向流程的基准,用于探索性现实世界数据分析。 DataClaw 包含大约 206 万条跨企业、行业和政策领域的真实世界记录,并保留了本机数据噪音。它还包括源自智库咨询场景的 492 个跨领域任务,每个任务都注释有流程级评估的中间里程碑。这些注释使 DataClaw 能够衡量智能体的进展情况以及其推理在何处出现问题。对 8 个高级大语言模型进行的实验表明,当前的智能体在这种情况下仍然很不可靠,有 7 个模型的总体准确率低于 50%。过程分析进一步揭示了隐藏在错误答案和不同模型探索策略背后的部分进展。总体而言,DataClaw 提供了一个数据约束较少的诊断测试平台,用于探测自主数据分析代理的能力边界。

DataClaw:用于探索性现实世界数据分析的面向流程的代理基准
图1:DataClaw的总体框架。顶部 。数据注释管道。底部 。评估管道。每个代理运行在一个隔离的 Docker 容器中,在未开发的数据环境中定位相关信息,执行数值计算和文本理解,并生成最终答案,然后通过结果评估和过程评估来评估。