论文

比率-方差正则化策略优化

Ratio-Variance Regularized Policy Optimization

模型训练强化学习

摘要

标准 同策略 强化学习依靠启发式剪裁来强制执行信任区域,但这种机制通过不加区别地截断高回报但高发散的更新而带来了严重的成本。我们证明,显式约束策略比率方差为信任域约束提供了原则上的局部近似,从而消除了二进制硬裁剪的需要。通过充当分布式“软制动器”,这种方法保留了来自新发现的关键梯度信号,同时自然地降低权重并允许重复使用过时的 离策略 数据。我们引入${\bf R}^2{\bf VPO}$(比率方差正则化策略优化),它通过原始对偶优化框架实现此约束。对 7 LLM 量表、涵盖快速和慢速推理范式以及 10 机器人控制任务的广泛评估证明了所提出方法的通用性。 R$^2$VPO 在数学推理基准上实现了显着的性能提升,尤其是在较小模型上的改进尤为明显,同时显着提高了样本效率。此外,它在连续控制域中始终优于 PPO 基线,特别是在稀疏奖励和动态环境中。总之,这些发现将比率方差正则化确立为稳定且数据高效的政策优化的原则基础。