论文

超越欧几里德裁剪:通过黎曼等距策略优化克服 LLM RL 中的探索崩溃

Beyond Euclidean Clipping: Overcoming Exploration Collapse in LLM RL via Riemannian Isometric Policy Optimization

模型训练强化学习

摘要

强化学习(RL)已成为增强 LLM 推理能力的主导范式。然而,使用 PPO-Clip 的 RL 算法本质上受到探索崩溃的限制。随后的工作仍然主要是启发式的,未能确定 PPO-Clip 失败的根本原因。这项工作揭示了 PPO-Clip 的根本缺陷:它隐式地使用欧几里得度量来衡量策略差异,这在理论上与策略黎曼流形上的内在几何不一致。这种几何不匹配导致低概率区域的更新过于保守,而高概率区域的更新过于激进,最终导致探索崩溃。为了纠正这个几何缺陷,我们提出了黎曼等距策略优化(RIPO),它保证黎曼流形上的等距策略更新,有效地平衡探索和利用。我们进一步表明,RIPO 实现了有利的偏差-方差权衡,从而稳定了优化。大量实验表明,RIPO 在七个竞赛级基准测试中显着超越了现有的 LLM RL 算法(在 AIME24 上比 GRPO 提高了 60%)。