论文
PhysWAM:以几何一致性连接自动驾驶场景预测与动作生成
PhysWAM: Physically Consistent World Action Model for Autonomous Driving
摘要
世界动作模型(WAM)联合预测场景将如何演变以及Agent应如何行动,但是单独的联合生成并不一定会对这些预测施加共享的几何约束。我们提出了 PhysWAM,这是一种用于自动驾驶的统一世界动作模型,可在单个流匹配Transformer中对多视图视频、度量深度和自我运动进行共同降噪。对于测量场景几何中的地面世界和动作生成,我们引入了耦合点投影(CPP),它将生成的深度反投影为 3D 点,使用生成的 $SE(3)$ 自我运动对其进行转换,并最小化它们与使用记录的自我运动转换的 LiDAR 点的距离。这种几何约束通过共同监督生成的深度和运动以及标准流匹配目标,提高了与测量场景的物理一致性。在推理时,轨迹选择仅依赖于简单的无标签共识规则,没有学习的记分器或模拟器反馈。我们通过 NAVSIM v1 和 v2 规划、零样本闭环传输以及未来视频和度量深度预测来评估 PhysWAM。尽管 PhysWAM 的选择过程很简单,但它实现了强大的规划性能,并将零样本转移到看不见的驾驶环境。它还生成准确的度量深度和时间相干视频,CPP 改进了规划和深度预测。总之,这些结果表明场景深度和自我运动之间的几何关系提供了一种在简单的统一模型中耦合世界和动作生成的直接方法。