论文

BlueFin:在财务电子表格上对 LLM 代理进行基准测试

BlueFin: Benchmarking LLM Agents on Financial Spreadsheets

智能体系统Agent任务评测

摘要

我们提出了 BlueFin,这是一个基准测试,它要求 大语言模型 (LLM) 代理对专业金融领域的电子表格工作簿进行合成、操作和理解任务。尽管全球电子表格软件付费用户的估计数量为数亿——比全球专业开发人员的估计数量高出一个数量级——但用于探索和扩展电子表格领域 LLM 功能的资源相对较少,而专门用于反映专业财务角色所遇到的实际职业任务的资源则较少。作为回应,我们策划了一组 131 项具有挑战性、复杂的任务,这些任务与该领域的现实世界相关,其中包含 3,225 个细粒度标准;值得注意的是,我们的评分标准和 LM 评判评估由人类注释专家团队进行验证,从而对复杂任务进行高质量、精细的评估,这些任务难以以编程方式验证,但可以由 LM 评判代理进行可靠评估。我们的法官与专家共识 ($α=0.826$) 持平,宏观 F1 得分为 0.839。 Frontier LLM 在具有挑战性的基准测试中表现不佳,最强的 LLM 在任务中的平均得分不到 50\%——模型在动态正确性方面表现出特别的弱点。我们的贡献包括跨三类电子表格任务的示例数据集、开源工具和代理评估框架,以及现有前沿模型在我们的基准上的性能表征。