论文
InstanceControl:无需实例标签即可控制复杂图像生成
InstanceControl: Controllable Complex Image Generation without Instance Labeling
摘要
可控图像生成方法(例如 ControlNet)已表现出引入视觉条件(例如深度图)来指导图像生成的卓越能力。然而,这些方法通常难以处理复杂的多实例场景,经常导致实例之间的属性混淆。虽然最近的方法试图通过手动实例标记来缓解这种情况,但此类要求是劳动密集型的。在本文中,我们提出了 InstanceControl,一种新颖的多实例可控生成方法,消除了实例标记的需要。我们认为现有方法的主要瓶颈是无法在视觉条件下准确地将实例描述与其相应区域关联起来。为了解决这个问题,我们利用视觉语言模型 (VLM) 在文本提示和视觉条件之间建立实例级对应关系。具体来说,VLM自动从文本提示中解析实例描述,同时根据视觉条件预测实例掩码。此外,由于预测的掩模可能包含噪声,因此我们引入了自适应掩模细化策略,该策略可在生成过程中动态细化这些实例掩模。大量的实验表明,我们的方法优于最先进的方法,实现了卓越的保真度和精确的实例级控制。