论文
Argo-Bench:评估企业级工作流程上的数据Agent
Argo-Bench: Evaluating Data Agents on Enterprise-Scale Workflows
摘要
现实世界的企业数据科学和分析工作流程需要对数十个表进行推理、执行统计分析并根据结果采取行动。已建立的文本到 SQL 基准仅评估查询生成,审计发现它们的答案经常是错误的。由于真实的企业仓库过于敏感而无法发布,因此这些基准测试建立在公共数据集上,其中业务事件适合单个表。我们推出 Argo-Bench,这是一个包含 210 项数据科学和分析任务的评估框架。我们利用公共数据、同行评审的行业文献和监管文件,模拟了纽约市的一个真实规模的食品配送平台,模拟其2024年8100万份订单,并具有扎实的经济学、欺诈模式和市场激励措施。我们将这个世界导出到一个包含 235 个表和 75 亿行的 ERP 仓库,该仓库以 Oracle E-Business Suite 模式为模型。模拟器的真实状态不显示在Agent看到的仓库中,因此任务需要在采取行动前通过查询和导航仓库来重建事实。 Argo-Bench 超越了文本到 SQL 的范围:Agent记录诸如禁止欺诈帐户、分配配送员激励预算或发放欠薪等操作,评分者根据模拟器中的后果对每个操作进行评分。每个任务都有一个可执行的参考解决方案,展示仅使用仓库的可解决性。 14 个前沿和开放权重模型中最强的模型仅在 34.8% 的任务上得分为 95 或更高,平均得分为 59.5 分。我们希望 Argo-Bench 推动智能体在真实数据环境中理解、导航和行动的进步。