论文
MoE强化学习中的目标失真与训练不稳定性分析
Probing RLVR training instability through the lens of objective-level hacking
摘要
延长可验证奖励强化学习(RLVR)训练已被证明能持续提升大语言模型的推理能力,但训练往往容易出现不稳定,尤其是在混合专家(MoE)架构中。训练不稳定严重损害模型能力提升,但其根本原因与机制仍知之甚少。本文引入一个原则性框架,经由目标级作弊(objective-level hacking)的视角理解 RLVR 不稳定。不同于源自可被利用的验证器的奖励作弊,目标级作弊源于 token 级信用的错配,并表现为优化目标中的系统级虚假信号。基于该框架,结合在30B MoE 模型上的大量实验,我们追踪并形式化 MoE 模型一个关键病态训练动态的起源与机制:训练—推理差异的异常增长——这一现象被广泛与不稳定相关联,但此前缺乏机制性解释。这些发现为 MoE 模型不稳定背后的训练动态提供了具体且因果的解释,为设计稳定的 RLVR 算法提供指导。
