论文
DeforM:通过时空掩蔽生成推理引导的物理感知视频
DeforM: Reasoning-Guided Physics-Aware Video Generation via Spatial-Temporal Masking
摘要
视频生成模型可实现高视觉质量,但通常难以生成物理感知视频。与可以通过明确的轨迹或公式描述的刚体运动不同,复杂的变形动力学仍然难以合成。我们观察到,缺乏对动态区域进行局部化的物理推理,使得不相关的区域会稀释模型的注意力,从而导致生成失败。在本文中,我们提出了 DeforM,一种推理引导的图像到视频生成框架,可将模型的重点转向物理关键区域。为了推理和定位这些关键区域,我们引入了 VLM 引导的物理推理模块 DeforM-Reason,以识别目标对象并生成时空掩模。对于物理引导,我们开发了两种替代策略:用于 无需训练 机制分析的 DeforM-Free 和作为强大的基于训练的生成器的 DeforM-Injection。实验结果表明,DeforM 提高了生成的变形场景的真实感,在视觉质量和物理一致性方面均优于基线模型。