论文
RoPEMover:通过位置嵌入进行深度感知对象重定位
RoPEMover: Depth-Aware Object Relocation via Positional Embeddings
摘要
在单个图像中移动对象需要几何一致的空间重新排列,包括处理遮挡、显示以前未见过的区域以及保持连贯的阴影和反射。现有的方法不太适合这种设置,并且通常无法保持这种场景级的一致性。我们通过引入一种几何感知对象运动方法来解决这个问题,该方法直接对扩散 Transformer 的位置表示进行操作。我们的主要见解是旋转位置嵌入(RoPE)定义了一个结构化的空间场,可以明确地操纵该场以引发受控运动。我们将 2D RoPE 扩展为深度感知公式,对 3D 空间结构进行编码,从而实现一致的对象位移和场景感知更新。我们的模型是通过参数高效的 微调 使用合成数据与一小组真实图像相结合进行训练的。尽管实际监督很少,但它在大空间位移下保留了对象身份,在新显示的区域中生成合理的内容,并持续更新与场景相关的效果,例如阴影和照明。标准物体运动基准的实验结果证明了所有评估指标的最先进的性能。