论文
F-GRPO:用于统一候选生成和排名的分解组相关策略优化
F-GRPO: Factorized Group-Relative Policy Optimization for Unified Candidate Generation and Ranking
摘要
传统的检索管道通过候选检索和重新排名阶段来优化效用,其中排名在预定义的候选集上进行。 大语言模型 (LLM) 将其扩展为生成过程:给定候选池,LLM 可以生成一个子集并在单个自回归通道中对其进行排序。然而,这种灵活性带来了新的优化挑战:模型必须搜索组合输出空间,同时仅在生成完整排名列表后才接收效用反馈。由于此反馈是在完整的序列上定义的,因此它无法区分较差的结果是由于未能生成相关子集还是未能正确排列该子集而产生的。这种贡献分配差距使得端到端优化不稳定且样本效率低下。现有系统通常通过将候选生成与排名分开来解决这个问题。然而,这种解耦仍然与下游效用不一致,因为排名受到其接收的候选集的限制。为了弥补这一差距,我们提出了一个统一的框架,该框架既可以在单个自回归部署中执行,又可以通过分解组相对策略优化(F-GRPO)对其进行端到端优化。我们的框架将策略分解为候选生成和排名,同时共享单个 LLM 主干,并通过顺序不变的覆盖奖励和位置感知效用奖励联合训练它们。为了解决由此产生的特定阶段的贡献分配问题,我们使用单独的组相对优势在两阶段序列级目标内进行生成和排名。在顺序推荐和多跳问答基准中,F-GRPO 比 GRPO 和解耦基线提高了顶级性能,优于监督替代方案,并且与强大的零样本重排序器保持竞争力,并且在推理时没有架构变化。