论文

FinExam-10K:检索何时有助于财务推理?

FinExam-10K: When Retrieval Helps Financial Reasoning?

模型评测基准与评测资源

摘要

专业金融考试需要模型结合领域知识、计算和判断,但没有一个基准能够涵盖单一协议下的完整 CFA 和 FRM 结构。我们推出 FinExam-10K,据我们所知,该环境中报告的最大英语基准,包含 10,198 个专家重新注释的问题,涵盖 CFA I-III 级和 FRM I-II 部分。我们发布了 5,110 个问题,并隔离了 5,088 个问题,用于每季度维护的排行榜。为了将覆盖范围与本地可回答性区分开来,我们报告了一个包含 10,198 项的完整覆盖轨道和一个包含 7,625 项的上下文完整推理轨道,这是从所提供的记录中进行推理的声明的主要基础。在 17 个模型中,总体最佳准确率为 85.29%。在冻结的 Hard band 上,Full-Coverage Track 的最佳成绩为 34.68%,372 个 context-complete 项目的最佳成绩为 54.57%。所有 17 个模型共有 47 个上下文完整故障。 Function-RAG 和 FunctionGraph-RAG 挽救了数百个错误,但也推翻了许多正确答案,产生很少或负的净增益。仅根据公共数据训练的门根据问题和初始响应决定何时应运行 FunctionGraph-RAG。在 5,088 个保留的项目中,门针对 7.9% 的问题调用 FunctionGraph-RAG,并将准确率从 70.83% 提高到 71.23% (p = .0446)。