论文

理解和减轻数学推理测试时强化学习中的杂散信号放大

Understanding and Mitigating Spurious Signal Amplification in Test-Time Reinforcement Learning for Math Reasoning

模型训练强化学习

摘要

测试时强化学习 (TTRL) 始终通过伪标签在推理时调整模型,使其容易受到来自标签噪声的虚假优化信号的影响。通过实证研究,我们观察到中等一致性的反应形成了一个模糊区域,并构成了奖励噪音的主要来源。至关重要的是,我们发现这种杂散信号甚至可以通过群体相对优势估计来放大。受这些发现的启发,我们提出了一个统一的框架,即去偏和去噪测试时强化学习(DDRL),以减轻杂散信号。具体来说,DDRL 首先应用基于频率的采样策略来排除模糊样本,同时保持正例和负例的平衡。然后,它采用具有固定优势的去偏优势估计,消除了群体相关策略优化引入的偏差。最后,DDRL 结合了基于共识的 离策略 细化阶段,该阶段利用拒绝采样数据集来实现高效稳定的模型更新。在多个数学推理基准测试中对三个 大语言模型 进行的实验表明,DDRL 始终优于现有的 TTRL 基准。代码即将在 https://github.com/yuyongcan/DDRL 发布。