论文

DLWM:双潜在世界模型在自动驾驶中实现以高斯为中心的整体 预训练

DLWM: Dual Latent World Models enable Holistic Gaussian-centric Pre-training in Autonomous Driving

模型训练预训练

摘要

基于视觉的自动驾驶因其低成本和优异的性能而备受关注。与密集的BEV(鸟瞰图)或稀疏查询模型相比,以高斯为中心的方法通过使用3D语义高斯描述场景,是一种全面而稀疏的表示。在本文中,我们介绍了 DLWM,这是一种具有双潜在世界模型的新颖范例,专门设计用于在使用两个阶段的自动驾驶中实现以整体高斯为中心的 预训练。在第一阶段,DLWM 通过自监督重建多视图语义和深度图像来根据查询预测 3D 高斯。配备细粒度的上下文特征,在第二阶段,分别训练两个潜在世界模型以进行时间特征学习,包括用于下游占用感知和预测任务的高斯流引导的潜在预测,以及用于运动规划的自我规划引导的潜在预测。 SurroundOcc 和 nuScenes 基准测试中的大量实验表明,DLWM 在以高斯为中心的 3D 占用感知、4D 占用预测和运动规划任务中显示出显着的性能提升。