论文
GaussianDWM++:基于语言的 3D 高斯驾驶世界模型,用于统一场景理解、编辑和多模态生成
GaussianDWM++: Language-Grounded 3D Gaussian Driving World Model for Unified Scene Understanding, Editing, and Multi-Modal Generation
摘要
驾驶世界模型(DWM)最近在生成模型方面取得了迅速发展,但大多数现有方法主要集中在条件场景生成上,缺乏明确的 3D 场景理解、基于语言的推理和可控的 4D 编辑功能。此外,常用的点云、占用或 BEV 表示使得文本信息和底层 3D 场景结构之间难以实现细粒度对齐。为了解决这些限制,我们提出了一种基础特征高斯驾驶世界模型,它将场景理解、基于语言的推理、可控 4D 编辑和多模态生成统一在一个框架内。具体来说,我们引入了一个基础特征高斯分词器,它直接将 Qwen/SigLIP 视觉语言特征提取为 3D 高斯原语,构建一个紧凑的开放词汇高斯语义场。我们进一步设计了一个几何感知的高斯适配器,它将重要性感知的层次选择与文本条件的感知器式交叉注意力相结合,将密集的高斯原语聚合成紧凑的世界词元。为了提高表示兼容性,我们引入了基于 KL 的高斯图像分布对齐目标,该目标将高斯世界标记与基础图像标记对齐。基于对齐的高斯表示,我们的框架进一步支持指令控制的场景编辑,包括天气条件生成和动态车辆操纵。在更广泛的驾驶基准上进行的大量实验表明,我们的方法在场景理解、视觉基础、面向规划的推理和可控 4D 生成任务方面实现了最先进的性能。我们将在 Github 上公开发布代码和数据集。