论文

LILAC:用于开环轨迹生成的语言条件以对象为中心的光流

LILAC: Language-Conditioned Object-Centric Optical Flow for Open-Loop Trajectory Generation

摘要

我们使用基于流的轨迹生成来解决语言条件的机器人操作,这使得能够对对象操作的人类和网络视频进行训练,并且只需要最少的特定于实施例的数据。这项任务具有挑战性,因为从预操作图像和自然语言指令生成对象轨迹需要适当的指令流对齐。为了应对这一挑战,我们提出了基于流的语言指令引导的开环动作生成器(LILAC)。这种基于流的视觉-语言-动作模型 (VLA) 从 RGB 图像和自然语言指令生成以对象为中心的 2D 光流,并将该流转换为 6-DoF 操纵器轨迹。 LILAC 包含两个关键组件:语义对齐损失(Semantic Alignment Loss)和提示条件跨模态适配器(Prompt-Conditioned Cross-Modal Adapter),语义对齐丢失可增强语言调节以生成指令对齐的光流,提示条件跨模态适配器可将学习到的视觉提示与图像和文本特征对齐,为流生成提供丰富的提示。通过实验,我们的方法在多个基准的生成流质量方面优于现有方法。此外,在使用自由格式指令的物理对象操纵实验中,与现有方法相比,LILAC 表现出了更高的任务成功率。该项目页面位于 https://lilac-75srg.kinsta.page/。