论文
可预测的 GRPO:训练动态的封闭式模型
Predictable GRPO: A Closed-Form Model of Training Dynamics
摘要
我们开发了这些动力学的第一原理降阶模型。在通过预期奖励总结策略的单一平均场假设下,我们将 GRPO 更新减少为随机强制阻尼振荡器,其质量、阻尼和刚度通过优化器超参数以及单个测量曲率尺度以封闭形式固定——动量提供惯性,离策略 滞后侵蚀阻尼,并且组大小作为噪声温度进入前导阶。减少会产生三个后果。首先,它将经验单指数饱和定律作为其过阻尼极限,将拟合的平台、时间尺度和尺寸指数重新铸造为潜在势的不动点、逆刚度和曲率缩放指数,并通过保留的惯性项添加单指数无法表示的慢启动阶段。其次,它产生与独立可测量量而不是拟合量相关的预测:确定性轨迹的组大小不变性,具有 $1/G$ 平稳波动、刷新间隔中的急剧稳定性阈值以及过阻尼到振荡过渡。第三,它提供了诊断,将故障模式与单独的奖励曲线混为一谈——奖励作弊、优势退化、政策集中和动态不稳定。在三个模型和两个组大小中,闭合形式轨迹将训练奖励拟合为 $R^2 \geq 0.91$,并且平均轨迹对于前导顺序而言是组大小不变的 - 在奖励曲线和分布外转移到八个数学基准上 - 而组内奖励分布保留了主序温度图无法捕获的剩余 $G$ 依赖性。