论文

非对称优势调制校准 RLVR 中的熵动力学

Asymmetric Advantage Modulation Calibrates Entropy Dynamics in RLVR

模型训练强化学习

摘要

具有可验证奖励的强化学习(RLVR)极大地提高了 大语言模型 (LLM)的推理能力,但它经常受到 \textit{受限探索} 的影响,即策略迅速集中于一组狭窄的解决方案。一种常见的补救措施是熵正则化,它试图通过增加策略熵来保留探索。然而,对于 LLM-RL,这种干预对其系数高度敏感,可能会引入语义上较弱的不确定性,并且通常会产生有限的准确性增益。这就引发了一个更精确的问题:哪些熵有助于推理,哪些熵应该减少?为了研究这一点,我们将组相对策略优化(GRPO)中的优势估计器参数化为正向和负向结果条件通道,并分析它们的熵动态。我们的结果表明,正通道调制提高了与成功推理轨迹相关的 \textit{生产性熵},而负通道调制则消除了与失败采样轨迹相关的 \textit{噪音熵},并减少了对正确路径的干扰。在这种通道观点的指导下,我们提出了 \textbf{AsymGRPO},它将正负优势的调制强度解耦。这使得能够灵活地控制模型在提示难度级别上的更新方式,从而能够在较难的提示上更强地强化罕见的成功,或者在更容易的提示上更强地抑制残余失败,而无需强制两个通道共享相同的调制强度。对五个数学推理基准的实验表明,AsymGRPO 的性能优于强大的 RLVR 基线,并且跨模型主干具有一致的增益。