论文
从关联到因果:借助因果关系与注意力机制提升检索增强生成的检索精度
From Association to Causation: Improving Retrieval Precision of Retrieval-Augmented Generation via Causal Relations and an Attention Mechanism
摘要
检索增强生成(RAG)把 LLM 的生成接地在检索到的文档上,但标准的末端检索阶段——稠密向量相似度,可选地后接重排——常常返回与查询共享关键词却不含所需信息的文档,这一失效模式随知识库增长而加剧。我们把它归因于一个概念性缺口:相似度只捕捉关联关系,而真正重要的文档与查询之间是因果关联。我们用以赖兴巴赫共同原因原则为基础的因果图对末端检索阶段建模:查询与被检回文档共享的关键词构成潜在共同原因 A,文档的其余关键词构成潜在集合 B,把文档与理想输出联系起来。由于被检回文档是一个对撞节点(A → d ← B),检索本身打开了查询与 B 之间的关联路径,这支持一条免训练、注意力式的重打分规则:查询嵌入与 B 的加权质心嵌入之间的余弦相似度。与在知识内容内部建模因果关系的因果增强 RAG 变体不同,我们的图建模的是检索过程本身的因果结构。在一个 471 篇文档的真实企业知识库上,该方法把一份相关指南从第 6 位提升到前 3;在一个复现关键词堆砌环境的受控诊断语料上,它把目标平均排名从 2.88 提升到 1.25,而训练过的交叉编码器重排器几乎无效(2.63)。相反,在三个 BEIR 基准上该方法低于相似度基线,这划定了适用边界:该方法守护的是不断增长的专有知识库的关键词堆砌环境,并作为神经重排器的补充;语料级校准门控以 ≥ 95% 的可靠性选择正确环境。一个完全本地化的测试床证明了可部署性。