论文
Real2SAM2Real:生成 3D 缓存作为视频传播的补充上下文
Real2SAM2Real: Generative 3D Caches as Complementary Context for Video Diffusion
摘要
虽然视频扩散模型 (VDM) 擅长合成高保真视频,但实现精确的摄像机和场景控制仍然具有挑战性。现有方法主要依靠隐式扩散先验来生成未观察到的区域,这不可避免地导致高动态运动或复杂遮挡期间的结构崩溃。为了应对这一挑战,我们提出了 Real2SAM2Real,这是一个利用 3D 提升模型(例如 SAM3D)提取显式可编辑 3D 缓存的框架,作为 VDM 的强大几何支架。通过捕获前景实体的整个 3D 体积而不仅仅是其可见外壳,该缓存将整体空间先验注入到 VDM 中,为复杂的场景动态提供可靠的 3D 感知指导。为了有效利用这种 3D 指导,同时保留预先训练的先验,我们设计了一种软空间对齐注入机制以及为 VDM 量身定制的微创 微调 策略。此外,我们采用蒙版法线贴图作为跨模式桥梁来构建无 3D 数据管理和扰动管道。大量实验表明,Real2SAM2Real 能够对相机轨迹和多实体运动进行精确、解耦的控制。通过利用生成 3D 缓存的互补上下文,我们的框架克服了由于过度依赖扩散先验而导致的典型故障,在大相机移位和严重遮挡下保持了出色的时空一致性。至关重要的是,通过将几何形状与外观解耦,我们的 VDM 定制 3D 缓存消除了结构孔和错误立面导致的透视模糊性,以及反射和折射产生的误导性线索。项目网站https://jiayi-wu-leo.github.io/real2sam2real