论文

Dropout-GRPO:连续潜在推理的变分随机性

Dropout-GRPO: Variational Stochasticity for Continuous Latent Reasoning

模型训练强化学习

摘要

组相对策略优化 (GRPO) 依赖于每个组内 K 条采样轨迹的多样性;否则,组均值优势 $A^{(k)} = r^{(k)} - μ_r$ 崩溃为零。这对像 Coconut 这样的潜在推理模型提出了结构性挑战,这些模型经常提供连续的隐藏状态来代替离散的思想链标记。由于给定参数和提示,潜在阶段本质上是确定性的,因此多次采样轨迹会产生相同的轨迹,从而阻碍 GRPO 的进度。因此,将群体相关强化学习应用于连续潜在推理已被证明是困难的。为了解决这个问题,我们建议通过结构化退出来获取必要的随机性。通过应用在给定采样轨迹的所有潜在递归步骤中保持恒定的单个伯努利掩模,我们生成了基本的轨迹方差。这种共享掩码有效地将每次采样轨迹视为参数变分分布的后验样本,从而使 GRPO 能够优化贝叶斯模型平均策略的预期奖励。我们为这种方法提供了理论依据——包括无偏性、方差减少和潜在梯度的明确定义——以及经验验证。在 GSM8K 上,dropout-GRPO 将 Coconut 基线从 $27.29\%$ 提高到 $29.01\%$ pass@1,证明了 GRPO 学习对于潜在推理模型的可行性。我们的工作将其定位为 后训练 潜在推理 LLM 的实用且有理论基础的方法。