论文
扩散模型何时学习生成多个对象?
When Do Diffusion Models learn to Generate Multiple Objects?
摘要
文本到图像的扩散模型实现了令人印象深刻的视觉保真度,但它们在多对象生成中仍然不可靠。尽管这些失败有大量的经验证据,但根本原因仍不清楚。我们首先询问这种限制有多少是由数据本身引起的。为了理清数据影响,我们考虑不同数据集大小的两种机制:(1)概念泛化,在潜在不平衡的数据分布下训练期间观察到每个单独的概念;(2)组合泛化,系统地保留概念的特定组合。为了研究这些机制,我们引入了马赛克(多对象空间关系、属性、计数),这是一种用于数据集生成的受控框架。通过在马赛克上训练扩散模型,我们发现场景复杂性而不是概念不平衡起着主导作用,并且在低数据状态下计数特别难以学习。此外,随着训练期间出现更多的概念组合,组合泛化就会崩溃。这些发现凸显了扩散模型的基本局限性,并激发了更强的归纳偏差和数据设计,以实现稳健的多对象组合生成。