用于多跳检索的 LLM 重新排序器的每次查询门控
Per-Query Gating of LLM Rerankers for Multi-Hop Retrieval
摘要
LLM 重新排序器在图形增强密集管道(例如 HippoRAG2)之上添加了每 1,000 个查询 0.2-0.3 美元的数量级以及大约一秒的尾部延迟,并且在三个多跳基准测试中,它们将九个(数据集,K)单元格中的七个的最终跳 top-K 覆盖率提高了高达 +34.8 pp。我们询问学习的每个查询门是否可以在没有帮助的情况下跳过重新排序器,使用仅在 LLM 调用之前可用的功能(两个检索列表的 27 分和词法统计加上小型查询嵌入的 PCA)以及可执行后备。每个选择,包括回退和阈值,都是在训练折叠内做出的,并应用于保留的查询一次,并且有害的跳过(重新排名会找到目标,回退没有)会在聚合覆盖范围旁边报告。在 2WikiMultiHopQA、MuSiQue 和 HotpotQA 上的 9 个单元中,门会跳过 51% 的呼叫,平均保留 LastHop@K 成本为 1.2 pp;四个单元满足预先注册的 1 pp 规则,有害跳跃发生在八个中(190 个有害,136 个有益),并且相同跳跃率的随机门在高升力单元上损失 2 到 11 pp。第二条规则根据 Platt 校准危害概率(校准后 ECE 0.025,之前 0.094)的预期有害跳过率设定每个单元格的阈值,根据预先指定的预算:在 1 pp 预算下,门在 -0.8 pp 处跳过 42%,其中 66 个有害跳跃和 1 pp 内的 6 个单元格,但在 6 个单元格中实现的危害超出了承诺(平均 1.45 与 0.83) pp),我们量化的选择乐观主义; 0.5 pp 的预算可实现约 1 pp。危害概率经过校准,但几乎没有区别(AUC 0.16 至 0.70)。早期版本报告称“无损”节省了 73%;该数字基于预言机回退和错误的 MuSiQue 目标,我们记录了这两者。