论文

3DPhysVideo:通过 3D 场景重建和物理模拟生成视频的一致性引导流 SDE

3DPhysVideo: Consistency-Guided Flow SDE for Video Generation via 3D Scene Reconstruction and Physical Simulation

应用与实践内容创作

摘要

视频生成模型取得了显着的进步,但它们经常产生违反物理动力学基础的视觉伪影。最近的作品(例如 PhysGen3D)通过网格重建和基于物理的渲染来解决单图像到 3D 物理问题,但在流体动力学建模、多对象交互和真实感方面仍然存在挑战。这项工作介绍了 3DPhysVideo,这是一种新颖的 无需训练 管道,可以从单个图像生成物理逼真的视频。我们将现成的视频模型重新用于两个阶段。首先,我们将其用作新颖的视图合成器,通过使用渲染点云引导图像到视频 (I2V) 流模型来重建完整的 360 度 3D 场景几何形状。其次,将物理解算器应用于该几何体后,物理模拟点云用于指导相同的 I2V 流模型来合成最终的高质量视频。一致性引导流 SDE 将 I2V 流模型的预测速度分解为去噪和一致性偏差,强制条件输入的一致性,使我们能够有效地重新调整模型以用于 3D 重建和模拟引导视频生成。在包括多对象和流体交互场景在内的各种实验中,我们的方法成功地弥合了从单图像到物理上合理的视频的差距,同时保持在单个消费级 GPU 上运行的效率。它在基于 GPT 的分数、VideoPhy 基准和人类评估方面优于最先进的基线。