论文

海市蜃楼:重新思考推理密集型检索的信心

The Magnitude Mirage: Rethinking Confidence for Reasoning-Intensive Retrieval

上下文与知识检索增强

摘要

许多生产 RAG 系统通过对原始相似性分数进行阈值处理来实现检索放弃,隐式地将分数大小视为置信度信号。我们证明,当查询需要超出语义匹配的推理时,这种做法会系统性地退化。在 11 个检索架构和 28 个数据集中,神经检索器一致地为语义相关但违反约束的文档分配高相似度分数,导致基于幅度的阈值在逻辑和时间推理任务上崩溃,导致近乎随机的放弃性能——我们将这种失败称为“幅度幻影”。为了在没有计算成本昂贵的替代方案的情况下解决这个问题,我们对跨三个认知层的六个零成本查询性能预测(QPP)指标进行了大规模的实证研究:语义匹配(BEIR)、逻辑推理(BRIGHT)和时间推理(TEMPO)。我们的核心发现是,关键的改进来自于放弃大小,转而采用分数分布信号:这种转变带来的收益超过了分布替代方案之间的差异 5-10$\times$。特别是,在基于幅度的置信度几乎没有提供区分能力的情况下,分数差距 ($s_1 - s_k$) 以及分数幅度和方差 (LSMV) 的实际调整可将弃权 AUROC 提高高达 0.16。这些方法不需要额外的推理、再训练或延迟,使其成为已部署的 RAG 系统中幅度阈值的实用零成本替代方案。