论文
GeoWAM:自动驾驶的视觉几何世界行动模型
GeoWAM: Visual Geometry World Action Models for Autonomous Driving
摘要
世界动作模型(WAM)作为自动驾驶中场景演化和自我动作联合建模的框架,最近受到越来越多的关注。大多数现有的 WAM 通过将用于未来观察预测的视频生成主干与用于自我轨迹预测的动作头相结合来学习像素空间中的场景动态。然而,像素仅提供这些动态的间接表示:它们将几何和运动与外观、纹理和照明纠缠在一起,迫使模型从二维观察中推断出三维变换。我们认为,以点云为代表的几何形状为驾驶提供了更自然的状态空间,因为它明确地捕获了空间结构以及控制场景演化的刚性和非刚性变换,同时与执行驾驶动作的空间直接对齐。基于这一见解,我们引入了 \textbf{GeoWAM},一种用于自动驾驶的视觉几何世界动作模型。 GeoWAM 不是预测未来图像,而是经过预训练来预测未来场景几何形状,产生联合编码空间结构和时间演化的表示。然后,几何条件的动作头利用这些学到的几何动力学来预测未来的自我轨迹。广泛的开环和闭环评估表明,视觉几何世界建模比基于图像的替代方案产生了更强的驾驶策略,将未来几何预测建立为自动驾驶的有效预训练目标。