论文
基于上下文区域的拖动:将任何区域拖动到任何形状
In-context Region-based Drag: Drag Any Region to Any Shape
摘要
扩散模型在拖动式编辑中显示出了前景。以前的工作主要关注基于点的拖动,这本质上是不明确的。本文重点关注基于区域的拖动,并介绍了一种新颖的基于上下文区域的拖动(ICRDrag)方法。在上下文学习框架下,ICRDrag 使用源图像、源区域掩模和目标区域掩模,生成目标拖动图像。基于基本的上下文学习模型,我们引入了两种新颖的注意正则化:1)图像掩模注意一致性,以确保目标区域关注图像和掩模模态的相似源区域; 2)源-目标注意力对应,保证源区域和目标区域之间的相互对应。为了促进基于区域的拖动,我们还构建了配对区域数据集(PRD),这是一个具有配对蒙版和图像的大型数据集。大量实验表明,ICRDrag 在定量指标和用户研究方面均显着优于现有方法,实现了卓越的编辑准确性和视觉保真度。数据集、代码和模型可在 https://github.com/bcmi/ICRDrag-Region-Drag-Editing 获取。