论文

GMTS:基于梯度幅度的词元选择改进了 LLM 推理的 RLVR 训练

GMTS: Gradient Magnitude-based Token Selection Improves RLVR Training for LLM Reasoning

模型训练强化学习

摘要

强化学习(RL),特别是具有可验证奖励的强化学习(RLVR),最近已成为增强 大语言模型'(LLM)推理能力的核心范式,在推理任务中表现出显着的有效性。最近的研究表明,高熵标记在 模型训练 中发挥着极其重要的作用,因为仅使用最高 20% 熵标记进行训练即可产生显着的性能提升。然而,为什么这种高熵词元是有益的仍然没有得到充分理解。在这项工作中,我们发现,尽管一个答案中的高熵标记往往与大梯度幅度相关,但考虑到答案级别奖励信号的变化,仅熵无法一致地反映不同答案之间的标记重要性。基于这一观察,我们引入了基于梯度幅度的词元选择(GMTS)方法来量化词元重要性,该方法利用熵梯度连接来近似梯度幅度排名以进行词元选择。我们发现,在三个推理领域和各种模型大小中,对 GMTS 排名前 20% 的词元进行训练始终优于基于熵的词元选择,这表明 GMTS 为 RLVR 训练提供了更细粒度的词元贡献估计。