论文

SSI-Policy:学习用于视觉语言机器人操作的结构化场景界面

SSI-Policy: Learning Structured Scene Interfaces for Vision-Language Robotic Manipulation

摘要

现实世界的机器人操纵需要空间定位、任务感知推理和精确控制。在低数据环境下,学习此类能力变得尤其具有挑战性。先前的方法通常会权衡可扩展的任务级推理和显式的物理结构:基于视频的方法可能会在长范围内发生几何漂移,3D 方法通常需要深度感测,并且许多流/轨迹接口强调运动,而没有显式的仅 RGB 几何表示。我们引入了 SSI-Policy,这是一个围绕结构化场景接口 (SSI) 构建的模块化框架,这是一种统一的、仅限 RGB 的中间表示,可联合编码单目深度特征、基于语言的对象布局和指令条件的 2D 运动轨迹。至关重要的是,SSI 与机器人无关,并且可以通过无动作视频进行训练,将感知与控制脱钩,以便下游策略可以从少量演示中学习。在每个任务仅进行 10 个演示的 LIBERO 基准上,SSI-Policy 比最强的先前方法提高了近 15%,并且与利用大规模外部预训练的 50 个演示方法相比仍然具有竞争力。消融表明,几何和运动提示在共享界面中提供了互补的优势。我们进一步验证了 13 个现实世界任务,涵盖空间推理、跨实体迁移和丰富接触操作。