论文
忽略什么,反应什么:VLA 模型的视觉鲁棒 RL 微调
What to Ignore, What to React: Visually Robust RL Fine-Tuning of VLA Models
摘要
强化学习 (RL) 微调 在机器人操作中显示出视觉-语言-动作 (VLA) 模型的前景,但部署时的视觉变化带来了实际挑战。一个关键的困难是标准任务奖励监督任务的成功,但对于视觉变化是否与任务无关或改变操作所需的行为提供有限的指导。我们提出了 PAIR-VLA(视觉鲁棒 VLA 的配对动作不变性和敏感度),这是一种 RL 微调 框架,通过在 PPO 优化期间在配对视觉变体上添加两个辅助目标来解决这一难题:一个不变项,可以减少任务保留对(例如,不同的干扰项)的动作分布之间的差异,以及一个敏感度目标,鼓励可分离的动作分布任务改变对(例如,目标物体处于不同的姿势)。总之,这些目标将视觉变量从单纯的观察多样性转变为 RL 微调 期间的行为级别指导 同策略 响应。我们在不同的分布外视觉变化(包括看不见的干扰物、纹理变化、目标物体姿态变化、视点变化和光照变化)下,对两种代表性 VLA 架构(OpenVLA 和 $π_{0.5}$)的 ManiSkill3 进行评估。我们的方法比标准 PPO 持续改进,在 $π_{0.5}$ 上实现了 16.62% 的平均改进,在 OpenVLA 上实现了 9.10% 的平均改进。值得注意的是,消融进一步显示了视觉变化的泛化:从干扰物和纹理变体中学习的不变性指导转移到目标姿势和照明变化,同时添加对目标姿势变体的敏感性指导进一步提高了对干扰变化的鲁棒性,突出了行为级强化学习指导的更广泛的可转移性。