论文

UniGeo:通过视频模型统一相机控制图像编辑的几何指导

UniGeo: Unifying Geometric Guidance for Camera-Controllable Image Editing via Video Models

应用与实践内容创作

摘要

相机可控的图像编辑旨在在不同相机姿势下合成给定场景的新颖视图,同时严格保持跨视图几何一致性。然而,现有的方法通常依赖于碎片化的几何引导,例如尽管模型包含多个级别,但仅在表示级别注入点云,并且主要基于在离散视图映射上运行的图像扩散模型。这两个限制共同导致相机连续运动下的几何漂移和结构退化。我们观察到,虽然利用视频模型为相机控制的图像编辑提供了连续的视点先验,但如果几何指导仍然分散,它们仍然难以形成稳定的几何理解。为了系统地解决这个问题,我们在三个层面注入统一的几何指导,共同确定生成输出:表示、架构和损失函数。为此,我们提出了 UniGeo,一种新颖的相机可控编辑框架。具体来说,在表示级别,UniGeo 结合了框架解耦的几何参考注入机制,以提供强大的跨视图几何上下文。在架构层面,它引入了几何锚点注意力来对齐多视图特征。在损失函数层面,它提出了轨迹端点几何监督策略,以明确增强目标视图的结构保真度。跨多个公共基准的综合实验(涵盖广泛和有限的相机运动设置)表明,UniGeo 在视觉质量和几何一致性方面显着优于现有方法。