论文

通过最优系数校准强化学习中多标记预测的联合训练

Joint Training of Multi-Token Prediction in Reinforcement Learning via Optimal Coefficient Calibration

模型训练强化学习

摘要

可验证奖励的强化学习(RLVR)已成为提高 大语言模型 推理能力的标准范例,而多词元预测(MTP)已成为预训练中广泛采用的模块。将它们结合起来是一种自然的方法,但当前的 RL 实践分离了 MTP 梯度,因为联合训练会降低性能。我们从优化的角度重新审视这一失败。我们证明了 MTP 对 RL 目标的每步影响可以分解为两项:一阶相关性和二阶扰动惩罚。这种分解统一了三种 MTP 训练机制:分离、交叉熵损失和策略损失,并解释了每种方法成功或失败的原因。对策略损失的进一步分析表明,尽管它与直觉一致,但性能仍然下降:相关项衰减,而二次惩罚仍然存在。在分析的指导下,我们提出了最优系数校准(OCC),这是一种自适应方案,通过对数概率代理以可忽略的成本在线跟踪最优系数。在六个竞赛级别的数学推理基准中,OCC 始终匹配或超过分离基线,从而提高了联合 MTP-RL 训练性能。