论文
GAE:学习几何原生潜在空间以生成 3D 一致的世界
GAE: Learning a Geometry-Native Latent Space for 3D-Consistent World Generation
摘要
我们提出了一个紧凑的几何原生潜在空间作为感知和生成的共享基础。视觉生成器可以生成逼真的帧,而无需保留一致的 3D 场景。我们认为这不仅是一个建模问题,也是一个表示问题:生成器通常会演化以外观为中心的潜在特征,而感知模型则在编码跨视图结构的语义丰富的空间中恢复几何形状。我们没有将几何图形添加为另一个输出,而是将几何基础模型的特征重新参数化为紧凑的潜在空间以进行生成。我们通过几何原生自动编码器(GAE)实现了这种转变,其潜在特征可以联合解码为外观、深度、相机和点图。在这种状态下,标准条件流支持不同的生成任务。在固定生成器和训练协议的受控比较中,用 GAE 替换潜在变量可提高视觉质量和独立测量的 3D 连贯性:在 RealEstate10K 和 DL3DV 上,FVD 分别下降 $12.7\%$ 和 $23.1\%$,并且在 RealEstate10K 上相机轨迹误差减半。总之,这些结果表明,潜在空间是几何一致生成的核心,可以作为感知和生成之间的共享接口。