论文

面向检索增强生成的来源感知重排序:一种可靠性先验方法

Source-Aware Reranking for Retrieval-Augmented Generation: A Reliability Prior Approach

上下文与知识检索增强

摘要

标准的检索增强生成(RAG)流水线仅按语义相似度对检索到的文档排序,而不考虑来源出处或可信度。本工作评估了对 RAG 检索排序的一种简单且可解释的改进,将领域知识驱动的来源可靠性先验纳入其中。每篇文档根据其来源类型被赋予一个先验 λ(s),检索分数通过 score(q, d) = sim(q, d) * λ(s) 进行重加权。该框架在一个120篇文档的健康领域语料库上与仅基于相似度的基线进行对比评估。在这一受控设置中,来源感知重排序将 Precision@5 从 0.48 提升至 0.72,并在所评估的威胁模型(即低可信度来源可通过元数据识别)下减少了对抗性文档的平均检索。所有实验均在密尔沃基工程学院(Milwaukee School of Engineering)的 Rosie 高性能计算集群上执行,该集群提供了可靠且可复现地运行完整实验流水线所需的 GPU 加速基础设施。这些结果表明,在所述实验设置的限度内,来源感知重排序有望成为缓解 RAG 流水线中来源质量退化的一种潜在策略。

面向检索增强生成的来源感知重排序:一种可靠性先验方法:论文配图
图 1:系统架构概述。左侧分支显示仅基线相似性管道。右侧分支显示了具有可靠性加权、可选邻居平滑和可选查询后权重更新的源感知重排序管道。两个分支共享嵌入和检索组件,并在相同的查询集上进行评估。