论文
评估 RAG 中证据感知检索的下游效用
Assessing the Downstream Utility of Evidence-Aware Retrieval in RAG
摘要
检索增强生成(RAG)的检索评估越来越多地围绕检索到的段落是否包含可以支持生成的证据而设计,而不仅仅是主题相关性。我们研究这种与下游证据需求的更紧密结合是否也使得检索评估对于由此建立的决策更加有用。在五个检索基准和端到端 TREC RAG 2025 设置中,我们检查了四个角色的答案支持信号:比较 检索器、指导检索训练和系统选择、预测下游答案质量以及过滤提供给生成器的证据。信号改变检索排名,但其下游值并不统一。它不能可靠地改进 检索器 训练;使用它进行系统选择的好处取决于如何指示生成器使用检索到的证据;基于它的检索分数不能稳健地预测未见过主题的答案质量。在直接证据干预中,人类注释者确认过滤优先保留包含有用答案证据的段落,但不同的答案评估者对于结果答案是否有所改善得出不同的结论。这些结果表明,使检索评估更密切地反映生成所需的证据本身并不会使该评估的每个下游使用都更加可靠。因此,RAG 评估方法应根据其旨在支持的特定比较、决策和结论进行评估。