论文

关于 RLVR 中的隐式奖励过度拟合和低秩动态

On the Implicit Reward Overfitting and the Low-rank Dynamics in RLVR

模型评测模型行为与机制分析

摘要

最近的广泛研究表明,模型通过可验证奖励的强化学习(RLVR)获得的增强推理能力主要集中在 1 级组件中。基于这一观察,我们采用了周期性 Rank-1 替换并发现了一个违反直觉的现象:RLVR 可能会表现出对训练数据集的隐式奖励过度拟合。具体来说,即使模型在训练过程中的奖励相对较低,也可以在测试集上取得令人满意的性能。此外,我们描述了 RL 训练的三个不同属性:(1)RLVR 中的有效rank-1 组件除了数学推理能力之外不保留其他模型知识。 (2) RLVR 从根本上通过优化特定的奇异频谱来发挥作用。 RLVR 训练模型中几乎所有线性层的奇异值分布都表现为重尾分布。 (3) 与rank-1分量相关的左奇异向量在训练过程中表现出更强的对齐趋势,这与RLVR本质上优化采样效率的发现相呼应。总而言之,我们的发现和分析进一步揭示了 RLVR 如何塑造模型参数,并为改进现有 RL 范式或其他训练范式以实现持续学习提供潜在的见解。