论文

基于锚点的逐点 LLM 重新排序器何时有帮助? 检索器 质量、统计范围和锚点设计

When Do Anchor-Based Pointwise LLM Rerankers Help? Retriever Quality, Statistical Scope, and Anchor Design

模型评测模型行为与机制分析

摘要

基于锚点的逐点 LLM 重新排名根据共享参考段落对每个候选者进行评分,以按点成本恢复跨文档上下文。我们使用 GCCP/PAGC 作为代表性方法来研究这何时真正有帮助。我们的研究是繁殖优先的。我们使用复制作为基于锚点的逐点重排序的受控组件级压力测试的起点。我们最初的重新实现仅基于论文文本,达到了 0.24 nDCG@10,而不是报告的 0.66,这表明需要几个未记录的实现细节来重现该方法。在识别并恢复八个此类细节后,我们在 1.6% 的范围内重现了报告的结果,并使用经过验证的实施进行受控分析。我们发现核心对比评分思想在严格的统计校正下是稳健的。然而,原始论文中固定的两种设计选择不太可靠。首先,我们发现,当第一阶段 检索器 为 BM25 时,将对比分数与标准逐点相关性分数相结合会有所帮助,但当第一阶段 检索器 是更强的密集模型(例如 E5)时,则几乎没有好处或没有好处。其次,本文使用更复杂的锚点构建方法是不必要的。一个更简单的锚点,通过交错排名最高的句子构建,在整个数据集中匹配或优于它。这些发现在不同的 LLM 主干网络中是一致的,包括 4 位量化 72B 模型。总体而言,基于锚点的逐点重排序是有效的,但其收益主要来自对比评分,而不是来自更复杂的聚合和锚点构建选择,并且它们出现的条件比原始评估建议的条件更窄。