论文

WorkstreamBench:评估 LLM 代理在金融领域端到端电子表格任务的情况

WorkstreamBench: Evaluating LLM Agents on End-to-End Spreadsheet Tasks in Finance

智能体系统Agent任务评测

摘要

人们越来越期望 LLM 代理能够执行端到端工作流程,根据高级用户指令生成完整的工件。为了满足企业需求,前沿人工智能实验室开发了可以从头开始构建整个电子表格的代理。这在金融领域尤其重要,金融建模、预测和场景分析等核心工作流程通常通过电子表格进行。然而,现有的电子表格基准测试并没有衡量这种高级功能,而是侧重于问答或单一公式编辑。为了解决这一差距,我们提供了代理对端到端电子表格任务的首批评估之一,重点关注经济关键的财务工作流程,例如建模和场景分析。由于其中的可交付成果定期由多个利益相关者审查和修订,因此判断其质量必然涉及高水平标准,例如可读性或易于修改。为了反映解决方案质量的多维性质,我们开发了一个评估分类法,包括三个维度:准确性、公式和格式,每个维度都包含反映专业标准的细粒度标准。克劳德家族在我们的定性审查中领先于基准,并产生了最专业的输出,但即使是最强大的代理也经常达不到专业财务标准,并且随着难度的增加超出一些连锁计算而急剧下降。这表明当前的代理尚无法按照实际工作流程所需的复杂程度可靠地生成专业质量的电子表格。

WorkstreamBench:评估 LLM 代理在金融领域端到端电子表格任务的情况
图 1:与之前专注于电子表格原子任务的工作(左)相比,WorkstreamBench 评估了 LLM 代理在关键财务领域(右)完成端到端电子表格任务的情况,涵盖了决定专业环境中最终交付成果可用性的关键标准。先前的任务侧重于简单的原子任务,这些任务以问答或涉及很少值或公式的编辑为中心,其中评估很大程度上可以通过精确匹配来执行。相比之下,WorkstreamBench 期望获得完整的多页工作簿,因此采用以与专业环境相关的高水平质量(例如可读性)为中心的整体评估。