论文
SEM-ROVER:用于大规模驾驶场景生成的语义体素引导扩散
SEM-ROVER: Semantic Voxel-Guided Diffusion for Large-Scale Driving Scene Generation
摘要
可扩展生成户外驾驶场景需要 3D 表示在多个视点上保持一致并扩展到大区域。现有的解决方案要么依赖于提取到 3D 空间的图像或视频生成模型,从而损害几何一致性并将渲染限制为训练视图,要么仅限于小规模 3D 场景或以对象为中心的生成。在这项工作中,我们提出了一个基于 $Σ$-Voxfield 网格的 3D 生成框架,这是一种离散表示,其中每个占用的体素存储固定数量的彩色表面样本。为了生成这种表示,我们训练了一个语义条件扩散模型,该模型在局部体素邻域上运行并使用 3D 位置编码来捕获空间结构。我们通过重叠区域的渐进式空间绘制来扩展到大场景。最后,我们使用延迟渲染模块渲染生成的 $Σ$-Voxfield 网格,以获得逼真的图像,从而无需按场景优化即可生成大规模多视图一致的 3D 场景。大量的实验表明,我们的方法可以生成各种大规模的城市室外场景,可以使用各种传感器配置和相机轨迹渲染成逼真的图像,同时与现有方法相比保持适度的计算成本。