论文
DelTA:RLVR 的判别式词元贡献分配
DelTA: Discriminative Token Credit Assignment for Reinforcement Learning from Verifiable Rewards
摘要
可验证奖励的强化学习(RLVR)已成为提高 大语言模型 推理能力的核心技术。尽管其有效性,但响应级别奖励如何转化为 词元级 概率变化仍然知之甚少。我们引入了 RLVR 更新的判别器视图,表明策略梯度更新方向隐式充当词元梯度向量的线性判别器,从而确定在学习过程中增加或减少哪些词元概率。在标准序列级 RLVR 下,该鉴别器是由词元梯度向量的优势加权平均形成的正侧和负侧质心构建的。然而,这种质心构造可以由共享的高频模式主导,例如格式化标记、稀释稀疏但有区别的方向,从而更好地区分高奖励响应和低奖励响应。为了解决这个限制,我们提出了 $\textbf{DelTA}$,一种判别性词元贡献分配方法,该方法估计词元系数以放大特定于边的词元梯度方向并降低共享或弱判别性方向的权重。这些系数重新加权自归一化的 RLVR 代理,使有效的横向质心更具对比性,从而重塑 RLVR 更新方向。在七个数学基准上,Delta 在 Qwen3-8B-Base 和 Qwen3-14B-Base 上分别比最强的同规模基线高出 3.26 和 2.62 点。代码生成、不同主干和域外评估的其他结果进一步证明了 DelTA 的泛化能力。