论文

无需训练 通过动态空间引导和多路径修剪的对象背景组合 T2I

Training-Free Object-Background Compositional T2I via Dynamic Spatial Guidance and Multi-Path Pruning

模型推理解码与生成控制

摘要

现有的文本到图像扩散模型虽然擅长主题合成,但表现出持续的前景偏差,将背景视为被动且未优化的副产品。这种不平衡损害了全局场景的连贯性并限制了构图控制。为了解决这一限制,我们提出了一个 无需训练 框架,该框架重组扩散采样以明确考虑前景-背景交互。我们的方法由两个关键部分组成。首先,动态空间引导引入了一种软的、时间步长相关的门控机制,可以在扩散过程中调节前景和背景注意力,从而实现空间平衡的生成。其次,多路径剪枝执行多路径潜在探索,并使用内部注意统计数据和外部语义对齐信号动态过滤候选轨迹,保留更好地满足对象背景约束的轨迹。我们进一步开发了一个专门用于评估对象背景组合性的基准。跨多个扩散主干的广泛评估表明背景一致性和对象背景构图对齐得到了一致的改进。