论文
RealMaster:将渲染场景提升为逼真视频
RealMaster: Lifting Rendered Scenes into Photorealistic Video
摘要
最先进的视频生成模型可产生卓越的照片级真实感,但它们缺乏使生成的内容与特定场景要求保持一致所需的精确控制。此外,如果没有底层的显式几何结构,这些模型就无法保证 3D 一致性。相反,3D 引擎提供对每个场景元素的精细控制,并通过设计提供原生 3D 一致性,但它们的输出常常陷入“恐怖谷”。弥合这种模拟与真实的差距需要结构精度(输出必须准确保留输入的几何形状和动态)和全局语义转换(其中材质、照明和纹理必须整体转换以实现照片级真实感)。我们提出了 RealMaster,这是一种利用视频扩散模型将渲染视频提升为逼真视频的方法,同时保持与 3D 引擎的输出完全对齐。为了训练这个模型,我们通过基于锚点的传播策略生成配对数据集,其中第一帧和最后一帧被增强以实现真实感,并使用几何条件线索在中间帧之间传播。然后,我们在这些配对视频上训练 IC-LoRA,将管道的高质量输出提炼成一个模型,该模型可以超越管道的限制,处理出现在序列中的对象和角色,并无需锚帧即可进行推理。在复杂的 GTA-V 序列上进行评估后,RealMaster 显着优于现有的视频编辑基线,提高了照片真实感,同时保留了原始 3D 控件指定的几何形状、动态和特性。