论文

增强财务问答:银行财务报表的新颖基准数据集

Enhancing Financial Question Answering: A Novel Benchmark Dataset of Banks' financial statements

模型评测基准与评测资源

摘要

银行财务报表的比较分析对自动问答系统提出了重大挑战,因为其复杂性、篇幅较长、技术语言以及不同司法管辖区和机构的文本和数字内容的不均匀性。我们推出了 FinRAG-QA,这是一种新颖的金融问答基准数据集,其中包含针对 10 个标准化指标的 999 个从业者策划的问题,以欧洲和美国 24 家主要银行 2019-2023 年的 209 份年度报告和第三支柱报告为基础。与之前以美国备案和单一机构分析为中心的金融 QA 基准不同,FinRAG-QA 的目标是对平均 198k 字的文档进行跨机构检索,比任何现有的金融 QA 资源都长。在此基准测试中,我们评估多级 RAG 管道并隔离每个组件的贡献。上下文块丰富与检索优化嵌入模型相结合,将 NDCG@10 从 0.322 提高到 0.710;以检索 真值 为条件,推理优化生成器将答案准确性从 44.6% 提高到 79.0%(+34.4 个百分点),生成延迟大约为 20 倍。我们进一步表明,当第一阶段排名已经很强时,跨编码器重新排名会降低检索性能,并且单个排名靠前的块在生成时优于更大的上下文。实验于 2024 年底至 2025 年初使用当时可用的模型进行。