论文
事后贡献可以驻留在哪里:RLVR 中词元更新的有符号容量视图
Where Hindsight Credit Can Reside: A Signed-Capacity View of Token Updates in RLVR
摘要
带可验证奖励的强化学习(RLVR)提高了 大语言模型(LLM)的推理能力,但稀疏的结果奖励使 词元级 的贡献分配变得困难。我们将 词元级 贡献研究为从行为策略到事后后验的奖励条件转变。在自回归 RLVR 中,这种转变可以通过条件互信息(CMI)来表达,这表明词元熵上限可能是事后贡献。然而,熵表示容量而不是更新方向,因此我们引入四象限分解,通过奖励极性和词元熵来分离更新。受控干预表明,这两个因素共同影响了词元更新。持续的推理增益集中在有符号的高熵象限中,而低熵更新很快就会饱和。基于此分析,我们提出了后验感知策略优化(HAPO),这是对 GRPO 的一种符号保留修改,可执行容量引导的优势重新分配。在两种模型设置下的数学推理基准实验表明,HAPO 在熵感知基准中实现了具有竞争力的性能。