论文
优化训练策略的幻象:单调推理策略作为 LLM 强化学习的真正目标
The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning
摘要
强化学习 (RL) 在 大语言模型 (LLM) 后训练 中受到越来越多的关注,但 RL 训练仍然脆弱,可能会出现不稳定或崩溃。一个重要原因是训练与推理不匹配:LLM 采用独立的推理和训练引擎来提高生成效率和训练精度,在实践中,即使模型参数同步,训练和推理侧的相同轨迹也会出现不一致的概率。这自然会导致一种特殊类型的偏离策略的存在并毒害训练。之前的工作在解决off-policy问题上做出了各种努力,以稳定错配下的训练策略。在本文中,我们指出了现有工作忽略的目标偏差,即对训练引擎中的策略进行有效更新不一定能确保推理策略(即部署中使用的策略)的改进。为此,我们为 LLM RL 提出了一个新的策略优化目标,称为单调推理策略改进(MIPI)。遵循这一原则,我们引入了单调推理策略更新(MIPU),这是一个两步 LLM RL 框架,它构建采样器引用的候选更新,并使用推理端间隙代理选择性地接受同步候选。在高失配情况下在两个模型尺度上进行的实验表明,MIPU 提高了平均推理性能和训练稳定性。