论文
DepthArb:用于遮挡稳健图像合成的 无需训练 深度仲裁生成
DepthArb: Training-Free Depth-Arbitrated Generation for Occlusion-Robust Image Synthesis
摘要
文本到图像模型通常很难合成多个对象之间的正确遮挡关系,尤其是在密集重叠的区域中。许多 无需训练 布局引导方法强制执行 2D 空间约束,但没有明确解决依赖于深度的注意力竞争,这可能导致概念混合和难以置信的遮挡。为了解决这个问题,我们提出了 DepthArb,一个 无需训练 框架,它将遮挡生成制定为统一去噪轨迹内的注意力仲裁。 DepthArb 采用两种核心遮挡控制机制:注意力仲裁调制根据相对深度抑制前景支持内的背景对象注意力,而空间紧凑性控制则限制注意力分散以保持对象的一致性。由于干扰在生成过程中会发生变化,因此遮挡冲突估计构建了一个共享的空间冲突场,以自适应地对两个目标进行加权。通过统一的空间文本注意力接口,DepthArb 对 U-Net 交叉注意力和 MMDiT 联合注意力的图像到文本组件进行操作,无需模型重新训练。我们进一步介绍了 OcclBench,这是一个具有连续相对深度规范和特定于遮挡的评估指标的基准。 OcclBench 和公共基准测试的实验表明,DepthArb 在评估的基线上改进了多个布局和遮挡指标,同时保持了有竞争力的文本图像对齐。