论文

MoE强化学习中的目标失真与训练不稳定性分析

Probing RLVR training instability through the lens of objective-level hacking

模型评测模型架构模型训练MoE强化学习模型行为与机制分析RLVR

摘要

延长可验证奖励强化学习(RLVR)训练已被证明能持续提升大语言模型的推理能力,但训练往往容易出现不稳定,尤其是在混合专家(MoE)架构中。训练不稳定严重损害模型能力提升,但其根本原因与机制仍知之甚少。本文引入一个原则性框架,经由目标级作弊(objective-level hacking)的视角理解 RLVR 不稳定。不同于源自可被利用的验证器的奖励作弊,目标级作弊源于 token 级信用的错配,并表现为优化目标中的系统级虚假信号。基于该框架,结合在30B MoE 模型上的大量实验,我们追踪并形式化 MoE 模型一个关键病态训练动态的起源与机制:训练—推理差异的异常增长——这一现象被广泛与不稳定相关联,但此前缺乏机制性解释。这些发现为 MoE 模型不稳定背后的训练动态提供了具体且因果的解释,为设计稳定的 RLVR 算法提供指导。

以目标级作弊为视角探查 RLVR 训练不稳定性
图1:RLVR 中训练不稳定动态的机制示意。数值噪声与 token 级调制在 token 级权重中引入失真,这实质上等同于对优化目标的偏倚扰动。这些偏倚改变优化方向使其偏向虚假信号,最终导致不断增大的训练-推理差异。