论文
AffordDrive3D:具有空间理解的可供性感知世界动作建模
AffordDrive3D: Affordance-Aware World-Action Modeling with Spatial Understanding
摘要
世界动作模型最近通过共同学习未来场景预测和轨迹生成来改进自动驾驶。大多数现有方法主要通过 RGB 外观来模拟未来,最近的工作已经开始结合几何预测来提高空间理解。然而,密集的几何结构描述了整个场景的空间布局,但没有表明哪些部分与自我车辆的动作最相关。对于驾驶,模型还必须识别并预测可以安全移动的位置以及哪些区域可能会造成碰撞风险。联合建模与动作相关的区域和未来的几何形状可以为策略提供与驾驶相关的线索及其相应的空间结构。因此,我们提出了 AffordDrive3D,这是一种可供性和几何感知的世界动作模型,可以共同学习未来与动作相关的区域和空间结构。为了捕获驾驶可供性预测所需的场景语义和驾驶上下文,我们在 VLM 主干上构建 AffordDrive3D,以预测可驾驶区域和碰撞关键区域 直接影响自我运动的区域,同时从 RGB 世界模型潜伏预测未来的几何形状。在 NAVSIM 上,AffordDrive3D 以 91.3 PDMS 和 89.9 EPDMS 实现了最先进的性能,展示了对未来可供性和几何形状进行联合建模以进行轨迹规划的有效性。