论文

OccluRank:通过仅添加序数等级来生成可控遮挡感知布局到图像

OccluRank: Controllable Occlusion-Aware Layout-to-Image Generation by Adding Just an Ordinal Rank

应用与实践内容创作

摘要

布局到图像生成可以通过边界框布局实现显式空间控制,但边界框仅指定实例位置,无法表示其遮挡顺序。现有方法可能依赖于额外的几何条件,采用复杂的推理过程,或者聚合独立构建的实例表示,而无需显式建模其依赖于遮挡的交互。我们提出了 OccluRank,一种简单且可控的遮挡感知布局到图像框架,它仅用一个序数等级来增强每个边界框。 OccluRank 通过轻量级的基于排序的调节对用户指定的遮挡顺序进行编码,并引入顺序感知实例交互 (OII) 模块以在聚合之前联合更新排序调节的实例表示。这允许指定的顺序指导遮挡实例之间的信息交换,而无需额外的几何输入或专门的推理时间优化。我们进一步构建了 OccluLayout,一个合成训练数据集,其遮挡顺序和非模态注释直接从已知的场景几何形状导出,而不是使用辅助预测模型从部分遮挡的图像中估计。为了进行全面评估,我们引入了 OccluLayout-Bench,它使用多个多模态 大语言模型 评估器来评估实例存在、空间布局、属性和遮挡顺序,并结合 FID 来评估整体图像质量。实验表明,OccluRank 更可靠地保留目标实例、遵循指定的布局并实现所需的遮挡关系,同时保持可比较的属性一致性和整体图像质量。