论文
MMPhysVideo:通过联合 RGB 感知建模生成物理上合理的视频
MMPhysVideo: Physically Plausible Video Generation Through Joint RGB-Perception Modeling
摘要
尽管在生成视觉上令人惊叹的内容方面取得了进步,但由于仅像素重建,视频扩散模型 (VDM) 常常会产生物理上不一致的结果。为了解决这个问题,我们提出了 MMPhysVideo,这是第一个通过联合多模态建模来增强视频生成的物理合理性的研究。我们将感知线索(特别是语义、几何和时空轨迹)重新转换为统一的伪 RGB 格式,使 VDM 能够直接捕获复杂的物理动态。为了减轻跨模式干扰,我们提出了一种双向控制教师架构,该架构利用并行分支来完全解耦 RGB 和感知处理,并采用两个零初始化控制链路来逐步建立像素级一致性。为了提高推理效率,教师的物理先验通过表示对齐被提炼成单流学生模型。此外,我们还推出了 MMPhysPipe,这是一种专为构建物理丰富的多模态数据集而定制的端到端数据管理和注释管道。 MMPhysPipe 采用由视觉证据链规则引导的视觉语言模型 (VLM) 来精确定位物理对象,使专家模型能够提取多粒度的感知信息。无需额外的推理成本,MMPhysVideo 就能持续提高高级模型在 Videophy 和 PhyGenbench 基准上的物理合理性,并在现有方法中实现卓越的性能。