论文
打破视觉-动作捷径:通用机器人基础模型的潜在接口训练
Breaking the Vision-Action Shortcut: Latent Interface Training for Generalizable Robotics Foundation Models
摘要
机器人基础模型实现了强大的分布内性能,但在视觉分布变化下通常会降低性能。当学习从预训练的视觉表示生成动作时,模型可能会利用与任务无关的视觉线索,这些线索与训练分布中演示的动作相关。当这些相关性在分布变化下发生变化时,这种视觉-行动捷径可能会破坏泛化能力。减少这些捷径需要限制如何使用视觉信息来生成动作,同时保留与任务相关的空间信息。我们提出了潜在界面训练(LIT),这是一种与框架无关的两阶段策略,首先在没有图像的情况下建立空间目标条件动作先验,然后通过姿势监督的潜在界面约束视觉条件。第一阶段训练动作专家根据语言、机器人状态和每个演示块的终端 SE(3) 末端执行器姿势生成动作块,学习独立于视觉提示的目标导向动作生成。第二阶段引入了一个潜在界面,该界面聚合了视觉和语义表示,并作为预训练动作专家唯一的视觉调节途径。该界面受到监督以重建先前用于调节第 1 阶段的终端姿势,鼓励其保留动作生成所需的与目标相关的空间信息。在四种视觉-语言-动作和世界-动作架构(Pi0.5、MolmoAct2、FAST-WAM 和 ImageWAM)中,LIT 将 LIBERO-Plus 的整体成功率提高了 3.87-10.70 个百分点,同时保持或提高了 LIBERO 的平均成功率。现实世界的评估显示,在未见的相机配置、照明变化和干扰因素下,三项任务的成功率总体提高了 13.30-16.70 个百分点。