论文
用于新型机器人实施例的 OpenVLA-OFT 的 RL 自举
RL Bootstrapping of OpenVLA-OFT for a Novel Robot Embodiment
摘要
将预训练的视觉语言动作(VLA)策略应用于新机器人通常需要进行特定实施例的演示。对于形态与大型机器人数据集中看到的操纵器有很大不同的定制机器人来说,这种假设尤其具有限制性。我们研究了一个更难的设置:OpenVLA-OFT 在电缆驱动并联机器人 (CDPR) 上的零演示实施例对齐,具有简单的夹具和以前未见过的控制接口。我们在模拟中使用强化学习,而不是有监督的 微调,并根据模拟器状态计算出密集的几何奖励。训练分两个阶段执行:用于定向运动原语的 PPO 阶段,然后是从 PPO 检查点开始的 GRPO 延续,并具有包含对象条件命令的扩展指令空间。在四个共享方向指令上,平均保留成功率从 PPO 之后的 34.25\% 提高到 PPO$\rightarrow$GRPO 之后的 53.50\%,其中 \texttt{向左移动} 和 \texttt{向后移动} 的增益特别大。在 GRPO 阶段,我们另外在 8 个目标对象上引入 \texttt{move to <object>} 并获得 39/400 = 9.75\% 的严格成功,而定性执行轨迹经常在后期不稳定之前显示出正确的目标导向方法行为。与之前的 OpenVLA 和 OpenVLA-OFT 结果(依赖于演示数据集和大多数标准刚臂实施例)相比,我们的方法根本不使用特定于实施例的数据集。结果尚未建立稳健的操作,但它们提供了更有力的证据,表明仅 RL 引导可以为真正新颖的实施例创建第一个可用的语言条件控制器。