论文
斗篷:通过将末端执行器从 VLA 中屏蔽来实现零射击跨实体操作
Cloak: Zero-Shot Cross-Embodiment Manipulation by Masking the End-Effector from the VLA
摘要
我们提出了 Cloak,这是一种训练方法,通过从自己的手腕相机中隐藏末端执行器,赋予视觉-语言-动作 (VLA) 模型零镜头跨实体传输能力。末端执行器占据了手腕视图的大而一致的区域,并且将其屏蔽以实现与实施例无关的视觉推理。 Cloak 根据机器人已知的几何形状,准确、实时地模拟渲染掩模,无需分割或生成模型。在训练期间,我们增强掩模,以便模型泛化到训练时未见过的实施例。我们用 Cloak-VLA 演示了该配方,这是一个在单个平行爪夹具数据集上使用 Cloak 训练的 VLA。从未收集过新实施例的数据。 Cloak-VLA 将零射击转移到各种看不见的实施例,包括另一个抓手、另一个手臂和五指手,同时保留源实施例的性能。通过将手腕视图与其自身的实施方式解耦,Cloak 允许数据比收集数据的硬件更长久。