论文

RAGFlip:检索器升级中的查询级负翻转

RAGFlip: Measuring Query-Level Negative Flips in Retriever Upgrades

模型评测评测方法与指标

摘要

检索器升级通常使用聚合指标进行评估,这可以隐藏先前检索器已正确服务的查询的回归。我们将这些回归作为负翻转来研究:BM25 检索出判断的相关段落的查询,而替换则不会。我们在三个 BEIR 集合上评估 BGE-large、E5-large-v2 和 SPLADE:Natural Questions、HotpotQA 和 FiQA,跨五个检索深度。所有替换都提高了整体检索覆盖率。负翻转发生在每个设置中,并且根据语料库、检索器和深度而有很大差异。当 k=1 时,在评估的设置中,8.6-37.5% 的 BM25 成功丢失。在较大深度的设置中,负翻转率较低,其中 BM25 支持的队列在每个深度单独定义。这些费率使用任何相关的支持标签。在 k=10 的 HotpotQA 上,要求每次正 qrel 传递都会将负翻转率提高到 12.3-17.3%。简单的固定预算与 BM25 的组合减少了这些回归,而 HotpotQA 阅读器实验提供了有限的下游检查,其中一些检索翻转伴随着答案回归。这些结果促使使用查询级兼容性以及聚合检索质量来评估检索器更新。