论文

ANO:一种有原则的鲁棒策略优化方法

ANO: A Principled Approach to Robust Policy Optimization

模型训练强化学习

摘要

近端策略优化(PPO)在深度强化学习中占据主导地位,但面临着根本性的困境。其“硬裁剪”机制丢弃了异常值中有价值的梯度信息,导致样本效率低下。相反,删除裁剪(如 SPO 中)会使优化暴露于无界梯度,从而导致显着的不稳定和超参数敏感性。为了解决这个问题,我们建立了一个统一信任区域框架来概括现有的目标。在此框架内,我们基于一组设计原则推导出锚定邻域优化(ANO)。我们发现标准政策梯度的失败源于梯度对异常值影响的误用。我们提出了影响力递减原理,这是从单调惩罚(SPO)和硬阈值(PPO)到动态异常值抑制的范式转变,并证明了其在高方差随机优化中保持稳定性的必要性。理论上,我们证明 ANO 具有鲁棒优化所需的最小结构复杂性。根据经验,ANO 在 MuJoCo 基准上实现了最先进的性能,显着优于 PPO 和 SPO。值得注意的是,ANO 表现出卓越的稳定性,即使在 PPO 完全失败的激进超参数(例如,学习率比标准大 3 倍)下也能防止策略崩溃。

ANO:一种有原则的鲁棒策略优化方法
图 7:训练动态。 ANO 保持稳定的 KL 散度和结构熵。