论文
Latent-GRPO:潜在推理的组相关策略优化
Latent-GRPO: Group Relative Policy Optimization for Latent Reasoning
摘要
潜在推理通过将中间推理压缩为连续表示并显着缩短推理链,为显式推理提供了更有效的替代方案。然而,现有的潜在推理方法主要集中于监督学习,潜在空间中的强化学习仍然高度不稳定。我们通过组相对策略优化(GRPO)的视角研究这个问题,并表明直接使 GRPO 适应潜在推理根本上是不平凡的:潜在推理改变了概率密度和采样机制,导致三个耦合瓶颈:缺乏内在的潜在流形,无约束的探索将采样轨迹推离有效的潜在流形;探索优化错位,轨迹级奖励可能导致不正确的 词元级 更新;和潜在混合非闭合,其中联合增强多个正确的潜在路径可以产生无效的平均状态。为了解决这些问题,我们提出了 \textbf{Latent-GRPO},它结合了无效样本优势屏蔽、单侧噪声采样和最佳正确路径第一个词元选择。在四个低难度基准(例如,GSM8K-Aug)和四个高难度基准(例如,AIME)中,Latent-GRPO 在低难度任务上比其潜在初始化提高了 7.86 个 Pass@1 点,在使用 3--4$\times$ 更短的推理链时,在高难度任务上比显式 GRPO 提高了 4.27 个点。它还在 Gumbel 采样下实现了更强的 pass@$k$ 性能。这些结果表明 Latent-GRPO 是一种稳定、高效的潜在推理的有效方法。