论文
无法学习,还是无法衡量?论RLVR难度标签的可靠性
Unlearnable, or Unmeasured? On the Reliability of Difficulty Labels in RLVR
摘要
具有可验证奖励的强化学习(RLVR)已成为训练后提高推理能力的重要方法。最近的研究表明,一些困难的提示即使偶尔会产生正确的解决方案,仍然难以学习。我们重新审视这种不可学习性现象,发现受影响的提示确实有所改善,大约是可学习率的三分之一,而用于研究它们的难度定义集的可重复性远低于预期。这些难度标签是根据有限数量的采样响应来估计的。将它们跨种子组合可以进一步改变选择的提示,而不是简单地减少测量噪音。我们开发了一个基于采样的框架,用于量化这种不稳定性并确定需要多少评估才能可靠地重现难度分配。我们还重新审视了为解释不可学习性而提出的梯度相似性证据,并表明所观察到的部分分离的出现是因为困难的提示提供了较少的正确的滚动,从中可以估计其梯度。匹配此样本数会减弱梯度差异,但不会消除它。总体而言,缓慢学习现象在我们的重新分析中仍然存在,而用于定义它的提示和用于解释它的证据都需要更仔细的测量。