论文

使用基于渲染器的代理推理生成基于光照的视频

Lighting-grounded Video Generation with Renderer-based Agent Reasoning

应用与实践内容创作

摘要

扩散模型在视频生成方面取得了显着的进步,但其可控性仍然是一个主要限制。布局、照明和摄像机轨迹等关键场景因素通常是纠缠在一起的或仅弱建模,限制了它们在电影制作和虚拟制作等领域的适用性,在这些领域中,明确的场景控制是必不可少的。我们提出了 LiVER,一种基于扩散的场景可控视频生成框架。为了实现这一目标,我们引入了一种新颖的框架,该框架在显式 3D 场景属性上调节视频合成,并由具有对象布局、照明和相机参数密集注释的新大规模数据集支持。我们的方法通过从统一的 3D 表示中渲染控制信号来理清这些属性。我们提出了一种轻量级调节模块和渐进式训练策略,将这些信号集成到基础视频扩散模型中,确保稳定的收敛和高保真度。我们的框架支持广泛的应用,包括图像到视频和视频到视频合成,其中底层 3D 场景是完全可编辑的。为了进一步增强可用性,我们开发了一个场景代理,可以自动将高级用户指令转换为所需的 3D 控制信号。实验表明,LiVER 实现了最先进的照片级真实感和时间一致性,同时能够对场景因素进行精确、解开的控制,为可控视频生成设立了新标准。