论文

DataSpace:异构工作区中可验证分析的数据Agent基准

DataSpace: Benchmarking Data Agents for Verifiable Analytics over Heterogeneous Workspaces

智能体系统Agent任务评测

摘要

数据代理在组织工作空间中进行自然语言分析,这些证据可能分散在数据库、结构化文件、长文档和多媒体中。现有的基准测试主要隔离了结构化的查询、检索或开放式分析,而未能统一处理异构证据发现、完整的表格输出以及确定性的评估。我们引入DataSpace作为基准测试,其中数据代理从任务本地的异构工作空间生成可验证的表格结果。它包含410个跨语言的任务和7,439个总文件大小为15.01 GB的文件,包括CSV、JSON、SQLite、Markdown、PDF和视频格式。DataSpace还作为2026年KDD杯数据代理复杂数据分析竞赛官方评估基准。每个代理仅接收问题和工作空间,并返回请求的所有完整表格结果。我们使用DataSpace-Builder构建DataSpace,这是一个执行导向的框架,包含跨语言转换、约束感知的关系抽样、模态路由和文件呈现以及由11名领域专家进行的人类审查和任务修复。一个确定性评估器执行列标题不变的列对齐、类型和精度敏感的规范化以及有序的行比较。在最近发布的六种前沿多模态模型和五种广泛使用的代理驱动工具中,最佳准确率达到66.34%,而代理选择产生了15.36个百分点的差距,固定基础后。多模态证据集成和联接在所有六个基础架构上都持续降低准确性。这些结果表明DataSpace仍然不足饱和,并识别了提高数据代理可靠性的关键挑战。

DataSpace:异构工作区中可验证分析的数据Agent基准:论文配图
图 1. DataSpace 任务界面,以资金风险任务进行说明。该代理结合了来自视频的警报规则、从长 PDF 中提取的类别基准以及从 SQLite 查询的每日 NAV,然后对齐实体、计算请求的指标并返回完整的表格结果。