论文

同策略 蒸馏 满足 离策略 GRPO:训练紧凑指令跟随重排序器

On-Policy Distillation Meets Off-Policy GRPO: Training Compact Instruction-Following Rerankers

摘要

紧凑的指令跟随重排序器对于部署来说很有吸引力,但传统的 蒸馏 管道通常通过在一组固定示例上离线模仿教师输出来训练学生,从而限制了对教师观察到的排序空间的监督。我们通过强化学习的视角重新审视重排序器 蒸馏。我们提出了一个将 离策略 教师优化与 同策略 学生 蒸馏 相结合的两阶段框架。在第 1 阶段,使用 LLM 对 88K 指令跟踪示例进行判断反馈,通过 离策略 GRPO 增强 4B 教师重新排序器。在第二阶段,紧凑的 1B 学生根据自己的政策对排名进行抽样,并根据这些排名获得教师提供的软奖励,将学生探索与知识转移结合起来。我们最强劲的收益出现在分配转移中。在 MAIR-11(原始的 11 个子集、869 个查询评估)上,建议的学生达到 0.7670 nDCG@6,比离线列表 KD 高出 +4.6 分。与离线成对 RankNet KD 和 同策略 GKD 的受控比较表明,无论是更改离线 蒸馏 目标还是移动教师分布匹配 同策略 都无法再现基于奖励的 同策略 蒸馏 相对于学生抽样排名的性能。 MAIR-Full 上的优势依然存在:在所有 126 个任务和 9,356 个查询中,所提出的方法在评估的 蒸馏 变体中获得了最高的任务宏点估计,达到 0.6808 nDCG@6 和 0.7865 MRR@6。它还在可比较的 MAIR-11 评估中超过了两个已发布的 7B RL 训练的重新排名器,而相同的第 2 阶段训练程序持续改进了三个架构上不同的替代学生骨干网。在 9,861 个查询验证基准上,生成的 1B 重新排序器实现了 0.7624 nDCG@6,同时相对于更大的替代方案提供了有利的质量效率权衡。