论文

FinRank:SEC文件金融问答与检索的证据锚定基准

FinRank: An Evidence-Grounded Benchmark for Financial Question Answering and Retrieval over SEC Filings

模型评测基准与评测资源

摘要

金融问答通常以答案正确性来评估,但在SEC文件中,一个看似合理甚至数值正确的答案可能建立在错误的证据之上。相似的事实与披露会在同一文件的章节之间、同一公司的报告期之间以及可比公司之间反复出现。FinRank针对这一对来源敏感的检索问题,要求系统识别出对应预期实体、报告期与披露语境的证据。该基准包含1185条人工撰写的问答记录,覆盖22家公司的10-K与10-Q文件。每条记录包含参考答案、金标支持段落,以及从文件内、报告期间与可比公司之间的易混淆段落中人工挑选的困难负例。FinRank将段落检索、重排序与困难负例判别作为分开测量的任务进行评估。基线结果表明了该设置的难度:在被评估的系统中,即使是7B指令微调的嵌入模型在合并证据语料上也仅达到44.8%的Recall@10;十亿参数以下的编码器相比BM25最多提升3.5点,一个金融领域适配的嵌入模型落后BM25 9.7点,而当随机负例被替换为精选困难负例时,成对准确率下降13.0-20.5个百分点。FinRank提供了一个证据优先的基准,用于开发不仅准确而且锚定于正确披露的金融问答系统。