冷却采样器,而不是学习器:采样温度可消除重要性校正 GRPO 的陈旧悬崖
Cool the Sampler, Not the Learner: Sampling Temperature Moves the Staleness Cliff of Importance-Corrected GRPO
摘要
语言模型的生产强化学习让采样器落后于学习器,并用截断的重要性权重修复由此产生的不匹配。我们询问采样器在该校正下可以在没有刷新的情况下运行多长时间,并发现一个悬崖:在 Qwen2.5-Math-1.5B 和 GSM8K 上,每 192 次更新刷新一次重要性校正的 GRPO 在 180 个步骤中学习良好,然后在刷新到达之前在所有三个数据种子中严重退化。已发布的针对更新的过时行为的补救措施;我们改为对采样器进行操作。解耦冷却在温度 0.8 下抽取样本,而学习器、参考模型和重要性权重保持在温度 1,行为概率从缓和分布中记录,因此学习器的目标不变。所有相应的冷却运行都是稳定的,较长的间隔保持了短间隔所提供的结果:在相同的更新预算下,每 192 步刷新一次的冷却采样器与训练结束时每 96 步刷新一次的非冷却采样器相匹配(两者均为 0.857),并对其进行平均 (0.79),而将学习率降低到安全值最终会降低 3-7 个百分点。在 Qwen2.5-Math-7B 上,间隔 192 处的退化点预测间隔 144 在没有冷却的情况下是致命的,并且可以在冷却下生存;在两个数据种子上,未冷却的运行在第一次刷新之前就会降级,而冷却的运行则通过它并以 92-93% 和 68-81% 结束,其中一个冷却的运行在第二个周期后期短暂降级。好处有一个窗口:在安全间隔的三倍和高度不匹配的数学设置中,冷却延迟了退化而不阻止它,更强的冷却并不更好,并且没有校正的冷却崩溃。采样温度是对陈旧容限的控制,温度和刷新间隔应一起选择。