论文

FoMoVLA:为视觉-语言-动作模型架起视觉预见和运动指导的桥梁

FoMoVLA: Bridging Visual Foresight and Motion Guidance for Vision-Language-Action Models

模型训练监督微调与指令调优

摘要

视觉-语言-行动(VLA)模型在视觉运动政策学习方面取得了令人印象深刻的成果,但从根本上来说仍然是反应性的,将当前的观察和语言映射到行动,而没有对世界动态进行明确的前瞻性预测。现有的视觉预见方法可以预测未来的视觉状态,但缺乏明确的运动指导:它们显示要去哪里,但不显示如何到达那里。我们认为,未来特征预测和稀疏点跟踪自然是互补的:前者提供目标状态,而后者捕获朝向目标状态的连续运动路径。我们提出了 FoMoVLA,这是一个框架,通过联合学习未来特征预见和稀疏 2D 点跟踪,通过显式时空监督增强 VLA 表示,从而增强连续行动策略。 FoMoVLA 引入了紧凑的前瞻词元来解码未来的特征状态,解码稀疏的时间 2D 点轨迹以建模紧凑的几何运动,并通过轻量级的未来条件交叉注意力模块将两者结合起来,从而实现预期状态和点动态之间的一致推理。在 LIBERO、RoboCasa GR-1 Tabletop 和 LIBERO-Plus 上进行的大量实验证明了最先进的性能和强大的零样本泛化能力。项目页面位于 https://liauto-research.github.io/FoMoVLA。