论文

任何 3D 场景都值得 1K 词元:大规模场景生成的 3D 基础表示

Any 3D Scene is Worth 1K Tokens: 3D-Grounded Representation for Scene Generation at Scale

应用与实践内容创作

摘要

3D 场景生成长期以来一直由 2D 多视图或视频扩散模型主导。这不仅是由于缺乏场景级 3D 潜在表示,而且还因为大多数场景级 3D 视觉数据以多视图图像或视频的形式存在,这与 2D 扩散架构天然兼容。通常,这些基于 2D 的方法将 3D 空间外推降级为 2D 时间扩展,这引入了两个基本问题:(i)通过 2D 视图表示 3D 场景会导致显着的表示冗余,以及(ii)植根于 2D 的潜在空间本质上限制了生成的 3D 场景的空间一致性。在本文中,我们首次建议直接在隐式 3D 潜在空间内执行 3D 场景生成,以解决这些限制。首先,我们重新利用冻结的 2D 表示编码器来构建 3D 表示自动编码器 (3DRAE),它将视图耦合的 2D 语义表示转化为视图解耦的 3D 潜在表示。这使得能够以固定的复杂性和丰富的语义来表示从任意数量的视图(以任何分辨率和纵横比)观察到的 3D 场景。然后我们介绍 3D 扩散 Transformer (3DDiT),它在这个 3D 潜在空间中执行扩散建模,实现非常高效且空间一致的 3D 场景生成,同时支持不同的调节配置。此外,由于我们的方法直接生成 3D 场景表示,因此可以将其解码为沿着任意相机轨迹的图像和可选点图,而不需要每个轨迹扩散采样通道,这在基于 2D 的方法中很常见。