论文

生成世界渲染器

Generative World Renderer

模型训练合成数据

摘要

将生成逆向和正向渲染扩展到现实世界场景受到现有合成数据集有限的真实性和时间一致性的瓶颈。为了弥合这种持续存在的领域差距,我们引入了从视觉上复杂的 AAA 游戏中策划的大规模动态数据集。使用新颖的双屏拼接捕获方法,我们在不同的场景、视觉效果和环境(包括恶劣天气和运动模糊变体)中提取了同步 RGB 和 5 个 G 缓冲区通道的 400 万个连续帧 (720p/30 FPS)。该数据集独特地推进了双向渲染:实现强大的野外几何和材质分解,并促进高保真 G 缓冲区引导视频生成。此外,为了评估没有 真值 的逆向渲染的真实性能,我们提出了一种基于 VLM 的新颖评估协议,用于测量语义、空间和时间一致性。实验表明,根据我们的数据进行微调的逆渲染器可实现卓越的跨数据集泛化和可控生成,而我们的 VLM 评估与人类判断密切相关。与我们的工具包相结合,我们的前向渲染器使用户能够使用文本提示从 G 缓冲区编辑 AAA 游戏的样式。