论文
Rollout始于何处:面向RLVR的低负载、高杠杆首词元多样化
Where Rollouts Begin: Low-Load, High-Leverage First-Token Diversification for RLVR
摘要
可验证奖励强化学习(RLVR)无需标注轨迹即可训练推理模型,它依靠分组rollout让策略接触不同的推理路径,并由验证器为其打分。因此,rollout多样性已成为RLVR的核心瓶颈,现有方法大多通过温度、前缀或rollout选择方面的调整来拓宽探索。我们为拓宽这种多样性识别出一个在结构上特殊却被忽视的位置:推理标记之后的第一个词元。策略的首词元分布呈现尖锐峰值却与正确性解耦的现象,且首词元位置可以在不改变正确性信号的情况下拓宽一个rollout组所覆盖的区域。我们提出REFT(Rollout Exploration with First-Token Diversification,基于首词元多样化的rollout探索),它是对RLVR流水线的轻量补充:从策略自身的top-$N$候选中均匀采样首词元并均匀分配rollout,其余组件一概保持不变。用所得的多样化rollout进行训练后,REFT在四个基座模型(0.5B-7B)与三种难度区间上,汇总Pass@1、Pass@8与Pass@64均优于DAPO和GRPO基线。