论文
通过代理规划和图形引导优化生成物理感知视频
Physics-Aware Video Generation via Agentic Planning and Graph-Guided Optimization
摘要
视频扩散模型 (VDM) 在合成高保真、逼真视频内容方面表现出了卓越的能力。然而,它们从根本上缺乏对物理定律的内在理解,并且经常产生视觉上吸引人但因果不合逻辑的序列,其特征是结构幻觉和物理上不可信的动力学。通过免训练的测试时优化注入物理意识是一种有前途的替代方案,但现有方法依赖于全局梯度更新和严格的调度启发式方法,这些方法会无意中破坏被动背景,并且无法对复杂的动态状态变化进行建模。为了解决这个问题,我们提出了 PhysPlan,一种新颖的免训练指导框架,它将范式从随机视觉插值转变为代理物理模拟。首先,VLM 作为迭代认知模拟器运行,将多模态输入分解为视觉思维链,以创建运动轨迹和 3D 深度几何的多模态表示。其次,这些信号驱动以对象为中心的测试时间优化。与之前依赖全局梯度和严格调度启发式的免训练方法不同,PhysPlan 引入了以对象为中心的梯度路由来隔离运动学修改并完全锁定被动环境。此外,我们的动力学强度分析动态参数化框架超参数,以适应不同严重程度的物理变形。对PhyGenBench 和Physics-IQ 基准的广泛评估表明,PhysPlan 显着优于基础和可控VDM 基准,为提高视频生成的物理理解提供了一种有前景的方法。