论文
主动学习者作为高效的 PRP 重新排名者
Active Learners as Efficient PRP Rerankers
摘要
成对排名提示 (PRP) 从 LLM 引出成对偏好判断,然后通常通过经典排序算法将其聚合成排名。然而,判断是有噪声的、顺序敏感的、有时是不及物的,因此排序假设与设置不匹配。因为排序的目的是恢复完整的排列,所以截断它以满足调用预算不会产生可靠的 top-K。因此,我们将 PRP 重新排序重新定义为从嘈杂的成对比较中进行主动学习,并表明主动排序器是直接替代品,可以在调用约束机制中提高每次调用的 NDCG@10。我们的抗噪声框架还引入了随机方向预言机,每对使用单个 LLM 调用。这种方法将系统位置偏差转换为零均值噪声,从而实现无偏差的聚合排名,而无需双向调用的成本。