论文

群组编辑:一次性编辑多张图像

Group Editing: Edit Multiple Images in One Go

应用与实践内容创作

摘要

在本文中,我们解决了在一组相关图像中执行一致且统一的修改的问题。这项任务特别具有挑战性,因为这些图像在姿势、视点和空间布局方面可能会有很大差异。实现连贯的编辑需要在图像之间建立可靠的对应关系,以便可以将修改准确地应用于语义对齐的区域。为了解决这个问题,我们提出了 GroupEditing,这是一种新颖的框架,可以在组内的图像之间建立显式和隐式关系。在显式方面,我们使用 VGGT 提取几何对应关系,VGGT 提供基于视觉特征的空间对齐。在隐式方面,我们将图像组重新表示为伪视频,并利用预先训练的视频模型学习的时间相干性先验来捕获潜在关系。为了有效地融合这两种类型的对应关系,我们通过一种新颖的融合机制将 VGGT 中的显式几何线索注入到视频模型中。为了支持大规模训练,我们构建了 GroupEditData,这是一个新数据集,其中包含大量图像组的高质量掩模和详细说明。此外,为了确保编辑过程中的身份保留,我们引入了对齐增强型 RoPE 模块,该模块提高了模型在多个图像之间保持一致外观的能力。最后,我们提出了 GroupEditBench,这是一个专用基准测试,旨在评估组级图像编辑的有效性。大量实验表明,GroupEditing 在视觉质量、跨视图一致性和语义对齐方面显着优于现有方法。