论文
FlashRender:通过摄像机控制的视频 MeanFlow 进行少步生成渲染
FlashRender: Few-Step Generative Rendering via Camera-Controlled Video MeanFlow
摘要
我们推出了 FlashRender,这是一个只需几个步骤的生成渲染框架,可在几秒钟内沿着目标摄像机轨迹重新拍摄源视频。我们将采样步骤相关的相机控制视为现有多步骤生成渲染模型中离散化误差的一个突出表现,并表明解决这种不一致可以大大降低去噪轨迹曲率,从而促进后续步骤 蒸馏。为此,我们引入了表示变换和对齐(RETA),它将隐藏的源视频表示与来自冻结视觉几何模型的目标视频特征对齐。这直接对源视频流中的几何变换进行编码,从而实现采样步骤一致的摄像机控制。然后,我们使用 RETA 引起的较低曲率去噪轨迹上的 MeanFlow 目标对模型进行微调,使模型能够更有效地解决离散化误差。最后,我们应用 同策略 流映射蒸馏 来纠正固定少步采样下的自身采样轨迹中的错误。大量实验表明,RETA、MeanFlow 和 同策略 流映射蒸馏 在少步生成渲染中发挥着互补作用。它们共同使我们的方法能够以降低 25 倍的采样成本匹配视频质量和几何一致性的多步基线,同时实现卓越的摄像机可控性,即使在分布外的目标摄像机轨迹下也是如此。