论文
WorkstreamBench:评估 LLM 代理在金融领域端到端电子表格任务的情况
WorkstreamBench: Evaluating LLM Agents on End-to-End Spreadsheet Tasks in Finance
摘要
人们越来越期望 LLM 代理能够执行端到端工作流程,根据高级用户指令生成完整的工件。为了满足企业需求,前沿人工智能实验室开发了可以从头开始构建整个电子表格的代理。这在金融领域尤其重要,金融建模、预测和场景分析等核心工作流程通常通过电子表格进行。然而,现有的电子表格基准测试并没有衡量这种高级功能,而是侧重于问答或单一公式编辑。为了解决这一差距,我们提供了代理对端到端电子表格任务的首批评估之一,重点关注经济关键的财务工作流程,例如建模和场景分析。由于其中的可交付成果定期由多个利益相关者审查和修订,因此判断其质量必然涉及高水平标准,例如可读性或易于修改。为了反映解决方案质量的多维性质,我们开发了一个评估分类法,包括三个维度:准确性、公式和格式,每个维度都包含反映专业标准的细粒度标准。克劳德家族在我们的定性审查中领先于基准,并产生了最专业的输出,但即使是最强大的代理也经常达不到专业财务标准,并且随着难度的增加超出一些连锁计算而急剧下降。这表明当前的代理尚无法按照实际工作流程所需的复杂程度可靠地生成专业质量的电子表格。
