论文
通过图结构在线难度估计进行高效的 RLVR 调度
Efficient RLVR Scheduling via Graph-Structured Online Difficulty Estimation
摘要
具有可验证奖励的强化学习(RLVR)提高了 大语言模型 的推理能力,但依赖于成本高昂的轨迹采样探索。将相同的探索预算分配给不同难度级别的样本是低效的:简单的样本可能会收到多余的轨迹采样,而困难但可学习的样本可能会收到太少的探索。现有的自适应调度器通过基于课程的样本选择或基于估计样本难度的非均匀轨迹采样分配来解决这种不匹配问题。然而,获得可靠的在线难度估计仍然具有挑战性:专用探测增加了大量的生成开销,而基于历史的估计器面临着没有初始观察和陈旧反馈的冷启动,并且通常忽略样本之间的关系。为了解决这些限制,我们提出了一种基于图的即插即用在线难度估计器,它可以在相关样本之间共享轨迹采样反馈,并不断更新其难度估计,从而在无需专门探测的情况下减轻冷启动和过时性。具体来说,我们首先基于语义和推理相似性构建一个困难感知样本图。基于该图,我们引入了潜在的难度状态,并使用 Potts 先验来鼓励相邻样本共享相同的状态。然后,我们采用状态级 Beta-二项式模型来汇总与每个状态相关的轨迹采样结果。最后,我们使用在线平均场变分算法在新反馈到达时不断更新潜在状态分配和状态级难度。我们的框架可以集成到样本选择和轨迹采样分配调度程序中,从而无需专门的探测即可实现难度自适应探索。跨多个基础模型、强化学习调度程序和基准测试的实验表明,我们的框架实现了更好的性能。