论文
隐藏状态知道推理的分歧点:通过跨度 Wasserstein 距离进行贡献分配
Hidden States Know Where Reasoning Diverges: Credit Assignment via Span-Level Wasserstein Distance
摘要
组相对策略优化(GRPO)通过为采样轨迹中的所有词元分配相同的优势,在具有可验证奖励(RLVR)的强化学习中执行粗粒度的贡献分配。过程奖励模型可以提供更细粒度的监督,但它们需要步骤级注释或额外的奖励建模。我们表明,隐藏状态分布包含对局部推理质量有用的信号,可以仅使用 RLVR 中可用的结果级别正确性标签来提取该信号。具体来说,在每个 GRPO 组内,正确和错误轨迹的跨度隐藏状态分布之间的 Wasserstein 距离在其局部推理质量存在差异的区域周围增加。这种关联既适用于示例,也适用于个体轨迹,表明隐藏状态分布分歧可以作为细粒度贡献分配的自我监督信号。我们用分离定理形式化了这一观察结果,表明在温和的结构假设下,每当群体水平的分布差距超过有限样本噪声时,分歧后跨度的 Wasserstein 距离就大于分歧前跨度。受此结果的启发,我们提出 \textbf{S}pan-level \textbf{H}idden state \textbf{E}nabled \textbf{A}dvantage \textbf{R}eweighting (SHEAR),它通过使用跨度 Wasserstein 距离来缩放 词元级 优势来修改 GRPO,放大隐藏状态与相反组更分离的词元的更新。该方法不需要额外的模型,只需要对训练管道进行最小的改变。对五个数学推理基准和五个代码生成基准的实验表明,与标准 GRPO 相比有改进,并且相对于监督过程奖励模型具有强大的性能,同时不需要额外的注释或奖励 模型训练。