论文
不仅是地点,还有时间:RLVR 的时间调度
Not only where, But when: Temporal Scheduling for RLVR
摘要
具有可验证奖励的强化学习(RLVR)已成为大语言模型(LLM)的后训练的核心技术。虽然策略优化是由全球广播标量奖励下的所有采样词元驱动的,但沿着轨迹表现出的异构策略行为在很大程度上被忽视,没有区分。现有的工作通过贡献分配来解决这个问题,包括 词元级 优势重新加权和选择性词元优化,然而,分配标准在整个训练过程中基本上停滞不前,限制了弹性策略的演变。在这项工作中,我们认为 \textit{when} 学习信号被安排与 \textit{where} 它们在 token 之间分配一样重要,并引入了在 RLVR 优化过程中安排贡献分配标准的时间维度。我们发现,优先考虑特定策略行为所强调的目标词元,并逐渐减弱到一般优化会带来更稳定、更高效的学习动态。此外,我们表明简单的轨迹百分位数为区分策略行为提供了自然的视角,并且可以有效地与时间调度配合使用。我们的分析表明,标准优化在同时适应异构行为时会大大牺牲策略熵,而时间调度会产生更健康的策略演化动态。跨数学和一般推理基准的实验证明了一致的改进,表明时间调度构成了一个有前途的优化维度。