论文
Phantom:通过视觉和潜在物理动力学联合建模生成物理注入视频
Phantom: Physics-Infused Video Generation via Joint Modeling of Visual and Latent Physical Dynamics
摘要
在大规模数据集和强大架构的推动下,生成视频建模的最新进展产生了显着的视觉真实感。然而,新出现的证据表明,简单地缩放数据和模型大小并不能赋予这些系统对控制现实世界动力学的基本物理定律的理解。现有的方法通常无法捕获或强制执行这种物理一致性,从而导致不切实际的运动和动态。在他的工作中,我们研究了将潜在物理属性的推断直接集成到视频生成过程中是否可以使模型具有生成物理上合理的视频的能力。为此,我们提出了 Phantom,一种物理注入的视频生成模型,可以联合建模视觉内容和潜在的物理动力学。以观察到的视频帧和推断的物理状态为条件,Phantom 联合预测潜在的物理动态并生成未来的视频帧。 Phantom 利用物理感知视频表示,作为底层物理的抽象但信息丰富的嵌入,促进物理动力学与视频内容的联合预测,而不需要一组复杂的物理动力学和属性的明确规范。通过将物理感知视频表示的推理直接集成到视频生成过程中,Phantom 生成的视频序列既视觉逼真又物理一致。标准视频生成和物理感知基准的定量和定性结果表明,Phantom 不仅在遵守物理动力学方面优于现有方法,而且还提供有竞争力的感知保真度。