论文
ROVE:通过强化学习解锁人形操纵的人类干预
ROVE: Unlocking Human Interventions for Humanoid Manipulation via Reinforcement Learning
摘要
人类干预为 后训练 视觉-语言-动作 (VLA) 模型提供了关键的纠正信号。然而,由于复杂的全身运动学和灵巧的手控制,实现无缝人形干预是一项艰巨的系统挑战。因此,收集到的干预轨迹通常不是最理想的,依赖人类干预作为专家监督的方法可能会吸收犹豫、低效甚至错误的行为。为了解决系统和算法的挑战,我们提出了 ROVE,一种用于人形 VLA 后训练 的强化学习框架,具有不完美的人类干预。首先,ROVE 引入了人机循环管道,能够收集用于人形操纵的执行轨迹与干预数据。其次,它利用乐观价值估计(OVE)来优先考虑混合质量轨迹中的高价值行为。为了进一步增强价值估计,我们结合了跨实施例的人类经验视频,为长尾故障和恢复模式提供丰富的监督。由此产生的批评者会产生信息丰富的优势信号,引导 VLA 参与者专注于高价值行为,而不是不加区别地模仿所有行为。在挑战现实世界中接触丰富且细粒度的人形操作任务时,ROVE 的表现优于经验学习基线,并在多次轨迹采集与干预迭代中持续改进。