论文
X-Foresight:通过预测世界建模的联合视觉-行动因果预测网络
X-Foresight: A Joint Vision-Action Causal Forecasting Network via Predictive World Modeling
摘要
物理世界的知识主要存在于视频中。为视觉-语言-行动(VLA)模型配备此类知识是安全和通用规划的基础。预测世界建模使 VLA 能够通过根据过去的观察预测未来的视频来内化物理动力学和长期因果关系。然而,简单的下一帧预测面临两个挑战:1)与语义上不同的文本标记不同,视频标记是低熵且冗余的,导致预测退化为微不足道的外推。 2)世界建模提出了一个时间困境:密集预测捕捉瞬时动态,但无法有效地建模长期因果关系。为了有效地学习世界知识,我们引入了 X-Foresight,这是一种直接集成到 VLA 架构中的预测世界模型,可以共同学习世界建模和实时动作控制。其核心在于一种长范围的块式自回归策略,可以解决这两个挑战:通过预测语义上遥远的块而不是相邻的帧,它可以避免琐碎的外推,同时保留密集的块内帧以实现瞬时动态和稀疏的块间转换以实现长期因果关系。课程学习计划逐步扩展预测视野并稳定长期训练。为了有效地捕捉长期因果关系,我们提出了时间重要性采样,它将监督集中在由自我运动和行为信号识别的安全关键块上。我们进一步将真实感合成委托给基于扩散的多视图渲染器,从而改善真实感外观。综合实验表明,X-Foresight 在规划性能方面显着优于 VLA 基线,同时保持强大的生成保真度,为世界知识驱动的自治系统建立了强大的范例。