论文
FORCE-Bench:企业金融智能体AI的基准、数据集与评估环境
FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance
摘要
大语言模型的近期进展加速了智能体系统在运营金融中的部署。现有基准强调测量通用能力、指令遵循或安全,但很少直接针对智能体系统正被部署去自动化的运营金融工作流。金融从业者要求智能体不仅提供事实健全、恰当落地的信息,还要确保信息可验证、并一致遵守运营金融域的规则与约束。我们提出FORCE-Bench:含251个专家标注查询,以按运营金融域要求校准的量规框架在八个维度上评估响应——准确性、引用、清晰度、深度、落地性、时效性、相关性与结构。FORCE-Bench在三类任务上评估智能体系统:金融义务研究(查询ERP系统的应收应付数据)、金融主体表现研究(从公开申报与市场数据回答有时限的问题)、商业简报生成(综合多源公司情报报告)。为反映真实部署条件,我们在通用工具接入与时延受限设定下评估我们定制的智能体以及通用智能体系统。结果显示:通用智能体系统在运营约束下不能一致满足金融域质量要求,而定制化的Finance Agent for Microsoft 365 Copilot在各维度上更可靠。我们以开源发布数据集、量规、环境与分析代码,支持可复现比较与向其他企业金融环境的适配。
