论文

用于零样本模拟到真实 VLA 增强的以对象为中心的残差强化学习

Object-Centric Residual RL for Zero-Shot Sim-to-Real VLA Enhancement

模型训练强化学习

摘要

视觉-语言-动作(VLA)模型可以泛化不同的操作任务,但由于复杂的执行错误,它们基于模仿学习的策略在精确的物理交互中仍然很脆弱;纯粹在模拟中训练的强化学习策略能否提高现实世界 VLA 零样本的鲁棒性?残差强化学习在冻结的 VLA 之上学习纠正策略,提供了一个自然的框架,但现有方法面临着一个基本的模拟现实困境:特权状态方法需要有损 蒸馏 进行部署;基于图像的方法受到视觉域差距的影响;而现实世界的强化学习成本高昂且不安全。我们提出了一种以对象为中心的残差强化学习框架,该框架使用对象姿势来细化 VLA 动作,从而实现在模拟和现实之间一致传输的紧凑观察空间。为了协调这两个领域,我们另外在模拟中重放相同的远程操作演示,以训练现实世界 VLA 的模拟对应物。残余 RL 策略仅在具有姿态噪声注入和 dropout 的模拟中进行训练,并将零样本传输到真实机器人。在真正的 Franka Research 3 (FR3) 机器人上的五个操作任务中,我们的方法将零样本的成功率从 42% 提高到 76%,并且改进的执行轨迹可以进一步重复使用来重新训练基本 VLA 进行自我改进,而无需额外的远程操作。项目页面:https://www.microsoft.com/en-us/research/articles/object-centric-residual-rl/