论文

自动驾驶的关系基础潜在世界模型

Relationally Grounded Latent World Models for Autonomous Driving

摘要

潜在世界模型学习自动驾驶的预测表示,但这些状态保留的关系语义通常仍然是隐式的。我们研究交通场景图是否可以作为潜在世界表示的特权语义监督。在 LAW 的基础上,我们从 nuScenes 3D 注释构建以演员为中心的场景图,使用冻结文本嵌入模型对其序列化关系结构进行编码,并在训练期间将视觉潜在表示与该语义目标对齐。我们在推理时删除了监督分支,因此它既不需要场景图也不需要 3D 注释,并且不添加测试时计算。在 nuScenes 上,相对于我们重新训练的 LAW 基线,我们的方法将平均轨迹 L2 误差从 0.661 降低到 0.622 (5.9%),将碰撞率从 0.456 降低到 0.217 (52.4%)。它还优于非结构化标题式语义目标,支持潜在世界模型表示学习的显式关系结构的优势。