论文

较小的模型是 GRPO 政策层面多样性的自然探索者

Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO

模型训练强化学习

摘要

我们为 LLM 确定了增强组相对策略优化 (GRPO) 轨迹采样多样性的新维度。虽然 GRPO 依赖于多样化的轨迹采样,但主流策略主要通过注入更多 词元级 随机性来增加多样性,这可能会引入逐步噪声并导致不连贯的轨迹。我们发现,同一模型系列中的较小模型本质上表现出更高的策略级别多样性,随着样本数量的增加,它们相对于较大模型的 pass@k 更优,这表明了这一点。与 词元级 噪声不同,这种多样性是时间相关的,保持逻辑一致性,并为梯度估计提供结构化探索信号。因此,我们提出了 S2L-PO(从小到大策略优化),这是一个利用固定小模型作为自然探索器来训练更大模型的框架。为了平衡探索和利用,我们设计了一种渐进式退火策略,从离线小模型轨迹采样过渡到大型学习器自己的采样。这种转变巧妙地避免了小模型容量限制导致的训练中期性能下降,实现了更快的收敛并释放了更高的性能上限。 S2L-PO 提高了各种数学推理基准的准确性(例如,使用 1.7B 浏览器引导 8B 模型,在 AIME 24 上提高了 8.8%),同时减少了轨迹采样计算。