论文

财务证据拥挤:诊断和减轻检索增强生成中约束引起的位移

Financial Evidence Crowding: Diagnosing and Mitigating Constraint-Induced Displacement in Retrieval-Augmented Generation

上下文与知识检索增强

摘要

检索增强生成 (RAG) 检索候选证据并仅将有限的顶级子集(top-k 上下文)发送到生成器。在财务问答中,段落可能与查询的主题匹配,但与查询的期间、段、指标范围或表范围相冲突。我们研究由此产生的设定级别排序失败,我们称之为财务证据拥挤。 FinDeCrowd-Stress 通过匹配的兼容和不兼容候选池来隔离此故障,同时修复查询、相关证据、排名模型、候选计数和检索预算。在包含训练期间未见过的公司的 FinDER 测试拆分中,相对于同样困难的兼容池,不兼容池将前 10 名证据包含 (Recall@10) 减少了 0.147。这种差距表明,相互冲突的候选人消耗了有限的上下文位置并取代了支持答案的证据。然后,我们介绍 FinDeCrowd-RAG,这是一种学习分数校正,它将固定相关性分数与类型兼容性和本地词汇竞争相结合。查询级身份门仅在预测更好的顺序时才应用校正;否则,它保留原始排名。对于相同的受控候选,FinDeCrowd-RAG 通过恢复候选集中已存在的证据,将前 10 名证据的包含率从 0.757 提高到 0.902。在没有特定于查询的候选插入的情况下构建的 FinDER 索引上,门控重排序将包含率从 0.420 提高到 0.492,而前 100 个检索覆盖率在设计上仍保持为 0.743。使用固定的生成器,相同的排序更改可以提高 FinanceBench 和 FinQA 上的答案准确性和引文召回率。这些结果将约束引起的位移确定为可测量的 RAG 评估目标,并表明身份门控重排序可以恢复第一阶段检索已覆盖的证据。