论文

CAR:查询引导的置信感知重排序,用于检索增强生成

CAR: Query-Guided Confidence-Aware Reranking for Retrieval-Augmented Generation

上下文与知识检索增强

摘要

检索增强生成(RAG)依赖于证据排序来确定向生成器公开哪些信息,但现有的检索和重新排序方法主要估计查询-文档相关性。然而,相关性并不等于生成器端的有用性:相关的段落可能会引起歧义或分散注意力,而排名较低的段落可能会稳定生成器的答案。我们提出了 CAR(置信感知重排名),这是一个 无需训练 排名校正框架,它使用仅查询答案稳定性作为控制,并通过它在采样答案语义稳定性中引起的变化来衡量每个候选者。这种受控对比度估计文档对生成器行为的边际贡献,而不将语义稳定性视为相关性或校准正确性。 CAR 将这些置信度变化转换为粗略的优先级约束,并返回距基线最小肯德尔距离的可行排名,保留现有的成对偏好,除非生成器端证据支持逆转它们。在稀疏和密集 检索器 上的 NQ、HotpotQA 和 FEVER 上的实验、七种排序方法和三个生成器系列显示出强大的改进。在以BM25为中心的主要分析中,CAR实现了\textbf{+5.53\%平均相对NDCG@5增益};在固定的 NQ-answerable 下游评估中,它将 词元级 F1 提高了 \textbf{+0.43 点},排名和生成收益在各个排名者之间紧密一致 ($ρ= 0.93$)。这些结果将 CAR 定位为部署友好、生成器感知的校正层,可补充相关性,同时保留信息丰富的先前排名。 CAR 既不需要特定于任务的训练,也不需要访问模型内​​部(例如 logits 或隐藏状态),因此仅通过生成的输出即可适用于黑盒 LLM。