论文

ResRL:通过负样本投影残差强化学习促进 LLM 推理

ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning

模型训练强化学习

摘要

具有可验证奖励的强化学习(RLVR)增强了 大语言模型(LLM)的推理,但由于正奖励的过度激励,通常表现出有限的生成多样性。尽管负样本强化(NSR)等方法通过增加负样本的惩罚来缓解这个问题,但它们可能会抑制正面和负面响应之间共享的语义分布。为了在不失去多样性的情况下提高推理能力,本文提出了负样本投影残差强化学习(ResRL),它可以解耦正面和负面响应之间的相似语义分布。我们从理论上将惰性似然位移(LLD)与负正头梯度干扰联系起来,并推导出一个单前向代理,该代理通过上限表示对齐来指导保守的优势重新加权。然后,ResRL 将负标记隐藏表示投影到基于 SVD 的低秩正子空间上,并使用投影残差来调制负梯度,在保留多样性的同时改进推理,并在涵盖数学、代码、代理任务和函数调用的 12 个基准中平均优于强基线。值得注意的是,ResRL 在数学推理方面超过了 NSR,在 Avg@16 中超过了 9.4%,在 Pass@128 中超过了 7.0%。代码可在 https://github.com/1229095296/ResRL.git 获取。