论文
Lyra 2.0:可探索的生成 3D 世界
Lyra 2.0: Explorable Generative 3D Worlds
摘要
视频生成领域的最新进展为 3D 场景创建提供了新范例:生成模拟场景演练的摄像机控制视频,然后通过前馈重建技术将其提升为 3D。这种生成重建方法将视频模型的视觉保真度和创造力与可用于实时渲染和模拟的 3D 输出相结合。扩展到大型、复杂的环境需要在具有较大视点变化和位置重访的长摄像机轨迹上生成 3D 一致的视频,在这种情况下,当前视频模型会快速退化。现有的长视野生成方法从根本上受到两种形式的退化的限制:空间遗忘和时间漂移。随着探索的进行,先前观察到的区域超出了模型的时间背景,迫使模型在重新访问时产生结构幻觉。同时,自回归生成会随着时间的推移积累小的合成误差,逐渐扭曲场景外观和几何形状。我们推出了 Lyra 2.0,这是一个用于大规模生成持久、可探索的 3D 世界的框架。为了解决空间遗忘问题,我们维护每帧 3D 几何形状,并将其仅用于信息路由——检索相关的过去帧并与目标视点建立密集的对应关系——同时依赖生成先验进行外观合成。为了解决时间漂移问题,我们使用自我增强的历史进行训练,将模型暴露在其自身退化的输出中,教它纠正漂移而不是传播漂移。这些共同实现了更长且 3D 一致的视频轨迹,我们利用这些轨迹来微调前馈重建模型,从而可靠地恢复高质量的 3D 场景。