论文
SpatialDiff:通过隐式空间建模实现 3D 感知对象移动
SpatialDiff: 3D-Aware Object Movement via Implicit Spatial Modeling
摘要
图像编辑的最新进展允许对对象进行令人印象深刻的操作,但现有方法仍然难以处理复杂场景中的空间运动,例如对象跨越不同的深度层或被部分遮挡。大多数图像编辑方法仅关注二维数据集的先验信息,强调平面特征,而缺乏对空间结构的支持。即使包含显式位置信息的方法也无法捕获真实的 3D 空间关系,从而限制了复杂场景中对象的准确移动。在本文中,我们提出了 SpatialDiff,这是一种有效捕获 3D 空间结构的方法,能够在复杂场景中实现精确且一致的对象运动。我们的核心创新有两个:(1)隐式3D空间建模,引入3D先验知识,使模型内部建立对三维空间结构的全面理解; (2)全局空间监督,约束潜在的空间特征,使模型能够感知编辑操作引起的对象空间位置的变化。实验结果表明,我们的方法显着提高了复杂场景中空间运动的准确性和保真度。