论文

InfiniVerse:用于自动驾驶的占用引导无界场景生成

InfiniVerse: Occupancy Guided Unbounded Scene Generation for Autonomous Driving

应用与实践内容创作

摘要

生成真实、可控且时间连贯的城市环境是自动驾驶社区中一个关键但尚未解决的挑战。在本文中,我们介绍了 InfiniVerse,这是一种统一管道,用于从单帧对动态城市场景进行远程、2D-3D 对齐且可控的合成。在实践中,我们的方法首先从输入的多视图帧重建 3D 占用表示。这种表示作为沿着任意轨迹的自回归场景扩展的基础。随后,视频扩散模型将粗略的占用网格转换为真实的、时空一致的视频序列。此外,我们提出了一种分层草图和细化范例,其中生成的视频被重新投影为图像条件反馈,以增强 3D 占用表示,建立跨模式对齐以及视觉和空间域之间的相互增强。对 Waymo 开放数据集和 nuScenes 的广泛评估表明,InfiniVerse 实现了最先进的性能,FID 为 6.4,FVD 为 67.97,在持续时间和稳定性方面均显着优于现有基准。