论文
当难以置信的词元得到强化时:LLM 强化学习的尾部感知信用校准
When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning
摘要
强化学习(RL)在增强大语言模型(LLM)的推理能力方面取得了显着的成功。然而,广泛使用的无批评强化学习方法依赖于统一的信用分配,向所有词元传播相同的优势,无论其差异如何。我们确定了这种设计的一个关键失败模式,我们将其称为正信用污染:上下文错误的低概率尾部标记在同一轨迹内获得与看似合理的相同的正信用,从而导致有缺陷的推理行为的不加区别的强化。为了缓解这个问题,我们提出尾部感知信用校准(TACO),这是一种校准统一信用分配以抑制不需要的积极更新的方法。 TACO 首先计算尾部风险评分,其中包含本地生成环境,以评估每个词元落入不可靠尾部的风险,区分意外的稀有性和不确定性驱动的探索。然后,TACO 使用此分数来调整风险词元的正信用,而不完全消除其梯度,以便重复出现的有用的稀有模式可以积累强化,同时附带的噪音逐渐减弱。三个 LLM 和八个基准测试的实验结果表明,TACO 始终优于 GRPO 式基准。值得注意的是,TACO 提高了训练稳定性,支持长期强化学习的持续性能提升。源代码位于:https://github.com/xiuyilou/TACO。