论文
语言模型 RLVR 中的不可学习现象
The Unlearnability Phenomenon in RLVR for Language Models
摘要
事实证明,带有可验证奖励的强化学习(RLVR)可以有效提高 大语言模型(LLM)的推理能力。然而,RLVR 的学习动态仍未得到充分探索。在本文中,我们揭示了一个违反直觉的现象:在模型最初难以处理的困难示例中,即使存在正确的采样轨迹,仍有很大一部分子集无法学习。为了理解这种现象,我们首先证明现有的优化和采样技术无法解决不可学习性。通过跨示例梯度分析,我们表明不可学习的示例具有基本的表示问题,其特点是与其余示例的梯度相似性较低以及不可泛化的推理模式。我们进一步表明,强化学习中的表示缺陷很难缓解,因为数据增强并不能提高梯度相似性。我们的研究首次系统地描述了 RLVR 训练中不可学习的数据,并揭示了当前 RL 推理方法的基本局限性。代码和数据可在 \url{https://github.com/yulinchen99/unlearnability-rlvr} 获取。