论文

BoxCtrl:几何图像编辑的 3D 感知视觉提示

BoxCtrl: 3D-Aware Visual Prompting for Geometric Image Editing

应用与实践内容创作

摘要

随着基于指令的编辑模型和多模态 大语言模型 的进步,多样化的图像编辑任务已变得可行。然而,实现精确一致的几何图像编辑,例如在 3D 空间中平移、缩放和旋转,仍然是一个重大挑战。在这项工作中,我们介绍了 BoxCtrl,一个 3D 感知的视觉提示框架。与纯文本或粗略 2D 引导方法不同,我们的方法引入了投射到 2D 图像上的信息丰富的 RGB 3D 边界框作为视觉提示。每个盒子的三个正交面都涂有不同的 RGB 颜色,同时编码位置、大小和方向,以提供紧凑、直观的上下文视觉示例。 BoxCtrl 成功的关键在于这些精心设计的边界框,它们将几何控制与外观控制解耦。这使得模型能够学习潜在空间中相同颜色的面孔之间的一致对应关系,从而准确理解几何意图和准确的编辑结果。我们引入了一个两阶段训练范例:有监督的 微调 (SFT),然后是强化学习 (RL)。为了解决配对数据稀缺问题,我们构建了 SFT 的大规模合成数据集,为模型配备了基本的编辑功能。为了弥合合成域与真实域之间的差距,我们结合了一个利用不配对的真实世界数据的在线强化学习阶段。在评估几何精度和视觉保真度的奖励函数的指导下,我们的 SFT-RL 策略显着提高了几何精度,同时保持了逼真的质量。大量实验表明,BoxCtrl 在平移、旋转、缩放和复合编辑任务中实现了最先进的性能。