GIFT:通过机器人操作的面向动作的结构监督引导中间特征训练
GIFT: Guided Intermediate Feature Training via Action-Oriented Structural Supervision for Robotic Manipulation
摘要
视觉语言 预训练 和预测世界建模为机器人策略提供了丰富的语义和动态视觉特征,但它们的本机动作和视觉预测目标可能会忽略关键的物理和任务结构,同时保留与控制无关的视觉冗余。我们将视觉丰富度和控制效用之间的这种不匹配称为行动充足性差距。我们研究是否可以通过引导中间特征来弥合这一差距,以保留机器人操作中的三个控制相关结构:控制运动可行性的几何结构、可供性编码指令相关实体以及任务相关区域中的把指令定位到目标。为此,我们提出了 GIFT(引导中间特征训练),这是一种架构灵活的框架,用于学习中间特征,通过几何对齐、可供性预测和目标区域重建将这些结构转化为训练时间约束。我们在视觉-语言-动作(VLA)策略、直接动作世界动作模型(WAM)和逆动态 WAM 中实例化 GIFT,同时保留每个模型的动作公式。在零样本转移到 LIBERO-Plus 的情况下,GIFT-VLA、GIFT-WAM-Fast 和 GIFT-WAM-IDM 比 StarVLA-OFT、Fast-WAM 和 Fast-WAM-IDM 分别高出 4.6、12.6 和 5.2 个点,分别达到 79.6%、72.6% 和 87.8%。在 RoboCasa 上,三个 GIFT 变体的准确率分别达到 61.4%、83.6% 和 82.3%,分别比对应版本高出 12.6、9.0 和 8.4 个百分点。总之,这些结果将学习功能结构化的中间特征确立为跨模型特定动作公式的可重用原则,在关节式对象任务和在不可见的视觉和空间扰动下的高精度现实世界操作方面取得了特别大的进展。项目页面:https://openphoenix-team.github.io/GIFT-pages。