论文

UP:打破探索稳定性困境的无限正不对称优化

UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma

模型训练强化学习

摘要

强化学习(RL)已成为增强大语言模型(LLM)复杂推理能力的标准范式。为了实现样本效率,现代强化学习框架依赖于重要性采样 (IS)。然而,这些算法面临着探索稳定性的困境。纯粹的 IS 通常会导致灾难性的训练不稳定,而用于减轻这种不稳定性的标准裁剪机制严格限制了策略更新预算。通过形式化概率容量(Cap)的概念,我们揭示了保守的裁剪通过过早地截断正确但低置信度推理路径的更新预算来结构性地扼杀探索。为了摆脱这些限制,我们提出了无界正非对称优化(UP),这是一个通用且即插即用的目标。 UP 理论上通过停止梯度算子将策略锚定到当前状态来重构优化过程。这种不对称设计释放了未剪裁的稳定梯度,以获得积极的优势,以最大限度地探索,​​同时保持标准的剪裁保护措施,以获得消极的优势,以防止训练不稳定。此外,我们的公式很容易扩展到不同的优化粒度,包括 词元级(GRPO、DAPO)和序列级(GSPO)框架。大量实验表明,UP 增强了探索能力,并在不同的 RL 算法(DAPO、GSPO 和 GRPO)、模型架构(Dense、MoE 和视觉语言)和训练模式(语言和多模态)中实现了卓越的推理准确性,验证了 UP 是基于 RL 训练的真正通用的即插即用增强功能。