论文
即时支配和非对称验证者成本:GSM8K 上 1B 规模的 GRPO 经验消融
Prompt Dominance and Asymmetric Verifier Costs: Empirical Ablations of GRPO at 1B Scale on GSM8K
摘要
本文从两个方向研究了 1B 规模的 GRPO:估计器选择对学习信号有何影响,以及退化的奖励信号对学习内容有何影响。我们从头开始在 GSM8K 上训练 OLMo-2-0425-1B,并在受控扫描中测量两侧,包括同样降低训练奖励和测试时选择器的验证者质量实验。有四个结果脱颖而出。提示是一阶决策:零样本提示使基础模型保持在 0.08%(其输出是简并延续,而不是错误答案),因此几乎没有组携带梯度,并且训练成功,因为 3 样本提示达到 18.3%。在这个规模上,估计器变体位于种子噪声内,GRPO 博士在两个种子上都领先。在关闭策略的情况下,裁剪就是整个故事:没有裁剪比率的训练数据相对于开启策略参考损失了 4-6 个点,而 GRPO 式裁剪和 GSPO 完全恢复了损失。最后,相同的弱验证器在 RL 中比在测试时选择中便宜得多:10% 翻转验证器使 RL 的可达到增益保持不变(两个种子中保留 91% 和 106%),其中选择保留 57%,而仅格式验证器使 RL 保留其增益的 16-30%,而选择则基本上什么都没有。翻转噪声充当预期奖励的仿射变换,并且 Adam 重新缩放的群体归一化优势将其完全消除;残差是在 30% 翻转率下进行匹配步骤比较测试的二阶方差效应。