论文

超越模仿:通过 离策略 Q-Planning 自我改进机器人策略

Beyond Imitation: Self-Improving Robot Policies via Off-Policy Q-Planning

模型训练强化学习

摘要

行为克隆(BC)推动了机器人操作方面的显着进步,但它从根本上受到其无法自我改进的限制:如果没有额外的人类示范,失败的政策就无法从失败中吸取教训。强化学习 微调 提供了一条自我改进的途径,但事实证明很难扩展到支撑现代机器人策略的数十亿参数模型。我们提出了 Q-Planning,它为大型视觉运动 BC 策略配备了小型 离策略 Q 函数。因为 Q 函数估计价值而不是模仿操作,所以它可以在与 BC 策略相同的成功演示上进行训练,然后吸收成功和失败的实际执行轨迹,这是不对称 BC 所不具备的。我们利用这种不对称性来实现推理时的价值引导动作选择(BC 绘制的单步 Q 加权平均值)和在线自我改进,仅微调 Q 函数,而不影响 BC 权重。在 LIBERO 和双手 RoboTwin 上,十次自我改进迭代提高了我们测试的每个基准分数(LIBERO-10 93% 到 99%,RoboTwin 83.8% 到 91.4%),并缩短了接近天花板套件(LIBERO-Object、LIBERO-Goal)的成功次数。在两个接触丰富的双手真实机器人任务中,相同的循环(BC 冻结,无人工干预)纯粹通过其自身的实际执行轨迹而得到改进:在五次迭代中,堆叠杯从 40% 提高到 90%,插入钱包从 25% 提高到 80%,而仅成功执行轨迹上的SFT 就停滞在 55% 和 30%。在相同的在线预算下,Q-Planning 是 Best-of-N、filtered SFT、IBRL、DSRL 和 DAWR 中唯一能够从失败中稳定改进而无需训练辅助参与者的方法。