论文
通过内在梯度范数奖励的 LLM 的无验证强化学习
Verifier-Free RL for LLMs via Intrinsic Gradient-Norm Reward
摘要
虽然具有可验证奖励的强化学习 (RLVR) 最近已成为 大语言模型 (LLM) 的有前途的 后训练 范例,但它对黄金标签或特定领域验证器的依赖限制了其对新任务和领域的可扩展性。在这项工作中,我们提出了无验证者内在梯度范数奖励(VIGOR),这是一种仅使用策略模型本身的简单奖励。在给出提示的情况下,VIGOR 对一组完成进行采样,并为输出分配更高的组内奖励,从而在当前参数下诱导教师强制的负对数似然梯度的 $\ell_2$ 范数更小。直观上,较低的梯度规范表明完成情况与当前政策更好地保持一致,作为政策优化的内在偏好信号。为了使这种内在信号适用于 RL,我们使用 $\sqrt{T}$ 缩放来纠正平均 词元级 梯度的系统长度偏差,并应用分组排名整形来稳定提示中的奖励尺度。在数学推理基准测试中,VIGOR 的性能优于最先进的内部反馈强化学习 (RLIF) 基准,并且仅在数学数据上进行训练时,它还表现出跨域迁移到代码基准测试的能力。例如,在 Qwen2.5-7B-Base 上对 MATH 进行后训练,VIGOR 在此基线上平均数学准确率提高了 3.31%,平均代码准确率提高了 1.91%,同时表现出更稳定的训练动态。代码可在 https://github.com/ZJUSCL/VIGOR 获取。