论文

具有截断目标的后验优化可提高生成策略学习的效率和稳定性

Posterior Optimization with Clipped Objective for Bridging Efficiency and Stability in Generative Policy Learning

模型训练强化学习

摘要

表达生成模型通过捕获时间扩展轨迹上的复杂、多模式动作分布来实现先进的机器人操作。然而,由于不稳定和样本效率低下,微调 这些通过强化学习的策略仍然具有挑战性。我们引入了带有裁剪目标的后验优化(POCO),这是一个有原则的强化学习框架,它将策略改进制定为针对时间动作块量身定制的后验推理问题。通过期望最大化过程,POCO 将奖励加权的隐式后验提取到策略中,而无需进行似然估计。此外,POCO 采用离线到在线范式,将在线探索锚定到预先训练的先验,其与模型无关的设计规模可以在无需架构修改的情况下微调大型 VLA 模型。对 7 个模拟基准和 4 个接触丰富的现实世界任务的评估表明,POCO 可以防止灾难性的策略崩溃,优于 SOTA 基线,并在现实世界任务中实现 96.7% 的成功率。视频可在我们的项目网站 https://cccedric.github.io/poco/ 上获取。