论文
时间强迫:视觉-语言-动作模型的 4D 表示对齐
Temporal Forcing: 4D Representation Alignment for Vision-Language-Action Models
摘要
最近的视觉-语言-动作 (VLA) 方法通过将其表示与 3D 场景几何结构对齐来提高操作性能。然而,由于缺乏时间信息,这些方法常常难以应对视觉相似状态之间的长视野操作和观察混叠:3D 场景几何形状仅捕获当前状态,而不是它随时间的演变情况。为了解决这个问题,我们提出了 Temporal Forcing,一种 VLA 模型的 4D 表示对齐方法。具体来说,我们首先引入一个历史路径,使普通 VLA 模型能够将观察历史总结为时间感知的潜在表示。然后,将潜在表示与预训练的 4D 基础模型提取的几何特征对齐,该模型通过时间一致的几何表示捕获不断变化的 3D 世界,从而能够更深入地理解动态环境。 LIBERO 上的时间强迫达到 98.8%,比其基本模型高 2.2 个百分点。在物理隐藏放置任务中,它将完整任务的成功率从 20.0% 提高到 43.3%。代码将公开。