论文

通过视觉语义事件链调节生成物理上合理的视频

Physically Plausible Video Generation via Visual-Semantic Chain-of-Events Conditioning

模型推理解码与生成控制

摘要

物理上合理的视频生成(PPVG)试图合成符合物理原理的视频,但由于自然语言调节的规定不明确,仍然具有挑战性。先进的思想链 (CoT) 框架通过物理知识增强提示。然而,此类提示从整体上描述了物理现象,忽略了中间状态和过渡动态。在本文中,我们通过将物理进化表示为因果关联且物理约束的事件链,将 PPVG 重新表述为以事件为中心的生成。我们的框架包括三个关键模块:(1)物理驱动的事件链推理。该模块将物理现象分解为由不断演变的场景图表示的因果关系事件。由公式导出的物理量与相关对象和相互作用绑定在一起,表征每个事件转变的方向和幅度。 (2) 转换感知路由关键帧调节。该模块将每个事件路由到专门的关键帧合成运算符,以实现外观变化或对象变换。在去噪期间注入连续关键帧作为剩余指导,从而实现事件边界状态之间的平滑视觉过渡。 (3) 物理注入的对比语义指导。该模块构建了基于物理的积极和反事实的消极提示,以实现无分类器的指导,引导生成朝着合理的动力学方向发展,并远离违反物理的对应物。 PhyGenBench、VideoPhy、PhyWorldBench 和Physics-IQ 上的实验表明,我们的框架生成的视频在不同领域具有卓越的物理合理性。