论文
FOCAL-VLA:视觉-语言-动作模型的子任务引导几何蒸馏和隐式世界建模
FOCAL-VLA: Subtask-Guided Geometry Distillation and Implicit World Modeling for Vision-Language-Action Models
摘要
基于预训练视觉语言模型构建的视觉语言动作(VLA)模型在各种机器人操作任务中表现出了强大的性能。然而,直接将当前 2D 观察结果映射到动作的 VLA 模型通常缺乏足够的空间和时间理解,限制了它们在精确和长范围操作中的性能。最近的方法通过整个场景的几何监督和未来状态预测来增强 VLA 模型。然而,这些方法可能会受到冗余场景信息的影响,从而分散模型学习与当前交互相关的几何形状和动力学的注意力。为了解决这个问题,我们提出了 FOCAL-VLA,一个将子任务引导的几何蒸馏与隐式世界建模相结合的框架,以学习当前空间结构和未来交互动态的表示。为了将几何学习集中在当前子任务上,我们通过将几何潜在特征与子任务相关图像区域的特征对齐,将几何知识从 VGGT 转移到 VLA 模型。为了捕捉当前交互的未来 3D 演变,我们使用来自当前和未来演示框架的 Track4World 功能合并隐式世界建模。这两种互补的表示共同指导动作生成,而无需在推理时运行 VGGT 或 Track4World。实验表明,FOCAL-VLA 在模拟基准和现实操作任务上均优于基线。项目网站:这个 https URL。