论文

学习从密集和遮挡的布局生成多个对象

Learning to Generate Multiple Objects from Dense and Occluded Layouts

应用与实践内容创作

摘要

文本到图像的扩散模型无法在密集的场景中生成正确的对象计数,其中重叠的实例崩溃成难以区分的结构,尽管在视觉上看起来似乎合理。我们将此视为实例所有权崩溃:来自重叠对象的词元通过注意力自由交互,而严重遮挡的实例由于其可见区域较小而受到较弱的监督。我们通过布局感知的注意力偏差来解决这个问题,该偏差将词元交互柔和地偏向区域一致的分组并抑制跨实例泄漏,并与非模态平衡损失配对,该损失根据遮挡级别放大被遮挡对象的梯度。为了进行系统评估,我们引入了 OverlapDepth-45K,这是具有非模态监督的密集重叠场景的基准。我们的方法大大提高了计数准确性并防止实例合并,同时保持图像质量。项目页面:https://bachngoh.github.io/AIBL