论文

FORCE-Bench:企业金融智能体AI的基准、数据集与评估环境

FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance

智能体系统Agent任务评测

摘要

大语言模型的近期进展加速了智能体系统在运营金融中的部署。现有基准强调测量通用能力、指令遵循或安全,但很少直接针对智能体系统正被部署去自动化的运营金融工作流。金融从业者要求智能体不仅提供事实健全、恰当落地的信息,还要确保信息可验证、并一致遵守运营金融域的规则与约束。我们提出FORCE-Bench:含251个专家标注查询,以按运营金融域要求校准的量规框架在八个维度上评估响应——准确性、引用、清晰度、深度、落地性、时效性、相关性与结构。FORCE-Bench在三类任务上评估智能体系统:金融义务研究(查询ERP系统的应收应付数据)、金融主体表现研究(从公开申报与市场数据回答有时限的问题)、商业简报生成(综合多源公司情报报告)。为反映真实部署条件,我们在通用工具接入与时延受限设定下评估我们定制的智能体以及通用智能体系统。结果显示:通用智能体系统在运营约束下不能一致满足金融域质量要求,而定制化的Finance Agent for Microsoft 365 Copilot在各维度上更可靠。我们以开源发布数据集、量规、环境与分析代码,支持可复现比较与向其他企业金融环境的适配。

FORCE-Bench:企业金融智能体AI的基准、数据集与评估环境:论文配图
图 1:Finance Agent Benchmark 在 Finance Agent(专用)、Claude Opus 4.7 和 Claude Haiku 4.5(Anthropic Claude CLI,推理工作 = 低)和 GPT 5.5(OpenAI Responses API,推理工作 = 低)的八个评估维度上得分。误差线显示 95% 的引导置信区间(n=1000n=1000 次重采样);星号表示相对于 Finance Agent 差异的统计显着性(*p<0.05{}^{*}p<0.05,p*⁣*<0.01{}^{**}p<0.01,***p<0.001{}^{***}p<0.001,LMM)。通用系统的锚定分数用阴影线 (†\dagger) 显示,反映了有限或不可比较的源覆盖范围。财务代理在所有方面都处于领先地位,在财务领域评估标准上展示了专用代理相对于通用代理运行时的优势。