论文
当更多的重新制定受到伤害时:使用排名反馈避免漂移
When More Reformulations Hurt: Avoiding Drift using Ranker Feedback
摘要
现代检索管道越来越依赖查询重构和神经重新排序来提高效率,但这会带来巨大的计算成本,并在召回率和查询漂移之间引入基本的权衡。生成许多重新编写的查询可以大大提高召回率,但天真地合并或彻底重新排列其结果的成本却过高。在这项工作中,我们认为核心挑战不是重构生成本身,而是在严格的推理预算下重构重构及其检索文件的自适应选择。我们提出 ReformIR,一个预算感知检索框架,将查询重构视为一流特征,并使用强大的重排序器作为教师来执行在线相关性估计。给定多个重新制定的查询,ReformIR 构建了一个大型候选池,并学习了一个轻量级代理模型,该模型根据特定于重新制定的检索信号来估计文档效用。在固定的重新排序预算下,代理自适应地优先考虑重新表述和文档,有选择地查询锚定到原始查询的教师重新排序器。这个过程增加了召回率,同时通过在线特征选择而不是重构来主动抑制漂移。我们对 MSMARCO 段落语料库和 TREC 深度学习基准 (DL19-DL22) 进行了广泛的实验。我们的结果表明,ReformIR 始终优于现有的重新配制策略,特别是随着重新配制数量的增加,先前的方法由于漂移而遭受严重的质量下降。我们的研究结果还表明检索系统设计的转变,而不是使用 大语言模型 作为重新排序器,在重新制定阶段通过反馈驱动的优化更有效地利用它们的能力。