论文

GeoWorldAD:自动驾驶的几何世界行动模型

GeoWorldAD: Geometry World Action Model for Autonomous Driving

模型架构新型架构

摘要

自动驾驶需要在动态 3D 环境中做出安全高效的规划决策。尽管最近的视觉/视频动作模型直接从视觉观察中学习策略,并随着视觉 Transformer 和大规模训练数据的进步而很好地扩展,但它们通常缺乏明确的几何基础和未来感知的空间指导,限制了它们平衡避免碰撞和推动进步的能力。在这项工作中,我们提出了 GeoWorldAD,一种几何世界动作模型,它以自我对齐的 3D 空间中的轨迹规划为基础,并通过潜在的未来几何标记来预测短视界场景演化。当前的几何形状为安全规划提供了必要的空间约束,而未来的几何形状揭示了周围的主体和以自我为中心的自由空间如何演变,从而在不牺牲安全性的情况下减少过度保守的决策。为了有效地利用这些几何线索,GeoWorldAD 通过迭代轨迹细化逐步聚合多尺度的当前几何图形和潜在的未来几何图形。 NAVSIM v1 和 v2 的实验展示了最先进的性能,突出了显式 3D 几何基础和未来几何世界建模对于安全高效自动驾驶的有效性。