论文

SpreadsheetBench 2:评估代理的端到端业务电子表格工作流程

SpreadsheetBench 2: Evaluating Agents on End-to-End Business Spreadsheet Workflows

智能体系统Agent任务评测

摘要

电子表格广泛用于业务分析、财务建模、报告和决策。然而,大多数现有的电子表格基准测试评估孤立的操作,例如单个公式生成或本地单元格编辑,因此无法捕获实际业务设置中的端到端工作流程。我们引入 \textsc{SpreadsheetBench 2},这是电子表格代理的工作流程级基准,涵盖三个任务类别:生成、调试和可视化。该基准由真实的业务数据(包括财务报告和公司文件)构建,并由领域专家进行注释和验证。该基准测试包含 321 个任务;每个实例平均有 11.8 个工作表,需要 593.5 个单元格修改,反映了具有跨工作表依赖性的大型多工作表工作簿。我们在统一的多轮代理支架下评估了八个前沿 大语言模型,并且还包括几个基于 LLM 的电子表格产品作为补充基线。结果表明,当前系统在现实工作流程中仍然远不可靠:最佳模型的总体任务准确率达到 34.89%,而调试准确率低至 12.00%。轨迹分析和失败分类进一步表明,电子表格检查不足和目标单元选择不正确是主要瓶颈。总之,这些发现将 \textsc{SpreadsheetBench 2} 定位为推进可靠电子表格自动化的具有挑战性的测试平台。项目页面:https://spreadsheetbench.github.io/