论文
LLM 推理的自适应负强化:RLVR 中校正和多样性的动态平衡
Adaptive Negative Reinforcement for LLM Reasoning:Dynamically Balancing Correction and Diversity in RLVR
摘要
具有可验证奖励的强化学习(RLVR)已成为提高大语言模型(LLM)推理能力的高效方法。最近的研究表明,负样本强化(NSR)——专注于惩罚不正确的步骤,而不是简单地奖励正确的步骤——可以在整个 Pass@k 范围内匹配甚至超过更复杂的框架(如 PPO 和 GRPO)的性能。然而,当前的 NSR 技术通常在整个训练过程中应用固定的惩罚,并以相同的权重对待每个错误的响应。为了解决这些限制,我们提出了 NSR 框架的两个扩展:自适应负样本强化。 A-NSR 使用与时间相关的调度功能,而不是使用固定的更新规则。在初始训练阶段,系统重点关注纠正错误以稳定模型。随着训练的继续,它会转向更微妙和受控的更新。我们还引入了置信加权负强化,其运作原理是不同的错误具有不同的重要性级别。 CW-NSR 根据模型的归一化序列似然分配特定的惩罚权重。如果模型对错误路径高度自信,它会受到更大的惩罚,而对于不确定的错误(模型正在有效探索的地方)受到的惩罚则不那么严格。我们的正式分析显示了这些机制如何控制 词元级 更新,从而允许模型利用先验引导的概率重新分布,同时提供针对过度拟合的自然防御。我们使用 Qwen2.5-Math-1.5B 架构在困难的推理数据集(包括 MATH、AIME 2025 和 AMC23)上评估了这些方法。