论文

无固定 Top-L 截止值的精确自适应混合检索

Exact Adaptive Hybrid Retrieval Without Fixed Top-L Cutoffs

AI 基础设施向量数据库

摘要

现代检索增强生成(RAG)系统通常融合来自密集和稀疏 检索器 的固定 Top-$L$ 结果,将后面的贡献视为零。因此,截止值决定了排名及其执行成本。然而,截断融合通常并不等同于完整列表融合:即使观察到的候选者包含完整列表 Top-$K$ 中的每个项目,未读的跨列表排名也可能会改变 Top-$K$ 成员资格或顺序。由于频道排名因查询和语料库更新而异,因此从历史查询中选择的深度可能无法可靠地传输。我们提出了精确自适应混合检索(EAHR),它将完整列表加权 RRF 定义的有序 Top-$K$ 固定为检索目标,并将通道深度视为特定于请求的执行状态。每向量标量量化 (PVS) 和 Posting Block-Max (PBM) 产生可恢复的精确密集和稀疏排名。 Fusion 会限制未读贡献,并仅在可以更改 Top-$K$ 时请求进一步排名。因此,每个成功的请求都会匹配完整列表融合,而无需预设 Top-$L$;否则,继续安全执行直至列表耗尽。在五个测试集合和五个时间语料库快照中,完整列表加权 RRF 仍然具有竞争力,而从历史查询中选择的固定深度不能可靠地传输。 EAHR 重现了所有 150 个查询快照组合中排序前 20 名的完整列表。在热缓存、交错、顺序平衡协议下,详尽批处理执行与 EAHR 的成对几何平均延迟比在 TREC-DL 2019 上为 23.35,在 TREC-DL 2020 上为 30.28。反相关排名耗尽了两个列表,并且 EAHR 的一些困难查询速度较慢。 EAHR 不保证每个请求都能加速;它修复了确切的结果,同时根据当前排名调整执行深度。