论文

重新制定 LLM 强化学习,以实现黑盒差异下的高效训练

Reformulate LLM Reinforcement Learning for Efficient Training under Black-box Discrepancy

模型训练强化学习

摘要

强化学习(RL)已成为一种关键的 后训练 范式,但它经常遭受不可预测的次优性能甚至训练崩溃的困扰。最近的研究结果将这些失败归因于隐藏的训练推理差异(或不匹配),该差异源于不同的底层引擎和架构。我们发现,当提供适当的学习信号时,训练策略可以主动自我纠正这种差异。然后,我们进一步凭经验确定一个差异容忍区域:在该区域内,积极缩小差异可以抑制政策探索并降低学习效率,而在该区域之外,减少过度差异可以提高优化一致性并提高可实现的局部性能上限。根据这些发现,我们将这个问题表述为差异约束马尔可夫决策过程(DCMDP),其中奖励最大化与调整训练推理行为的约束相结合,实现稳定的双目标优化。为了自适应地平衡性能改进和差异控制,我们引入了拉格朗日松弛机制,该机制根据当前的差异违规程度动态调整两个目标的相对权重。这实现了稳定的双目标优化:允许策略在容忍区域内自由探索,同时在差异超出安全边界时被引导回去。根据经验,DCMDP 显着提高了 8B 密集模型 (Qwen-3-8b) 和 30B 专家混合模型 (Qwen-3-30bA3b) 的性能,并支持异构训练范例,其中 LLM 可以在高保真训练设置中进行优化,同时明确对齐以实现低成本、资源受限的推理部署。