论文

BigFinanceBench:面向金融研究智能体的工作流锚定基准

BigFinanceBench: A Workflow-Grounded Benchmark for Financial-Research Agents

智能体系统Agent任务评测

摘要

仅当另一位分析师可以审计财务研究答案的生成方式时,财务研究答案才与决策相关:选择了哪个来源、使用了哪个期间和会计定义、做出了哪些假设以及如何进行计算。现有的财务基准主要评估孤立的子技能或最终答案,而导致可审计的推导本身未能得到充分衡量。我们引入了 BigFinanceBench,这是一个由 928 项专家编写的开放式金融研究任务基准,其中每个项目将一个真实参考答案与一个点加权评分标准配对,该评分评分标准将推导分解为独立可检查的步骤。 BigFinanceBench 以工作流程为基础,因为它评估完整的推导而不仅仅是最终的输出。该基准涵盖 36,241 个评分标准,支持整个分析师工作流程中的部分信用评估和故障定位。通过评估十个当前的前沿和开放权重代理,我们发现了巨大的空间:最好的系统仅达到 58.8% 的评分标准,最终答案的准确性是推导质量的有用但有损的代理,并且模型能力在整个财务工作流程中变化不均匀。

BigFinanceBench:面向金融研究智能体的工作流接地基准:论文配图
图 1:BigFinanceBench 上的模型性能:点加权评分标准得分(左)和最终答案准确性(右)。误差线显示问题的 95%95\% 引导置信区间;阴影线条是开放式重量系统。