论文

SeeTraceAct:来自跨实施例演示视频的可见性感知潜在规划

SeeTraceAct: Visibility-Aware Latent Planning from Cross-Embodiment Demonstration Videos

摘要

视觉语言动作模型(VLA)是有前景的通用机器人策略,但使其适应新任务通常需要昂贵的特定任务远程操作数据。作为替代方案,我们研究一次性演示条件 VLA,其中机器人策略以未见过的任务的单个演示视频为条件。我们发现,当成功执行需要精确定位小目标区域时,现有的端到端方法常常会陷入困境。为了解决这个限制,我们提出了 SeeTraceAct,这是一个演示条件的 VLA 框架,它通过对未来末端执行器轨迹的可见性感知预测来鼓励精确的空间定位。为了通过跨实施例演示实现可重复的评估,我们引入并发布了 RoboCasa-DC,这是 RoboCasa 的演示条件扩展,具有剧集配对的人形视频。 RoboCasa-DC 和现实世界基准(其中 Franka Panda 手臂以人体演示为条件)的实验表明,SeeTraceAct 的性能优于基线,在所有四种 RoboCasa-DC 设置中实现了最佳成功率,并将现实世界的平均成功率提高了 12.5 个百分点。