论文
Mind-VLA:视觉-语言-动作模型的指令感知空间表示对齐
Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models
摘要
最近的视觉-语言-动作 (VLA) 方法通过将其表示与 3D 场景几何结构对齐来提高泛化能力。然而,这些方法基本上与指令无关:表示统一对齐整个场景,忽略由语言指令指定的特定目标对象的 3D 几何形状。这会导致细粒度操作和目标遮挡任务失败,而这些任务的成功取决于对目标对象而不是整个场景的准确 3D 理解。为了解决这个问题,我们提出了 Mind-VLA,一种用于 VLA 模型的指令感知空间表示对齐方法。具体来说,Mind-VLA首先获取语言指令指定的目标对象,然后准备其规范目标视图并提取相应的VAE和VGGT特征。最后,VLA 模型的潜在表示与这些特征相一致,以实现指令感知的 3D 理解。 Mind-VLA 在 LIBERO 上达到 94.4%,在 CALVIN 上达到 4.47,具有紧凑的 345M 参数骨干网。在具有目标遮挡的真实机器人任务中,Mind-VLA 的平均成功率达到 54%,比匹配的场景-VGGT 控制高出 26 个百分点。