论文
以统一语义—空间评测比较布局引导扩散模型
Benchmarking Layout-Guided Diffusion Models through Unified Semantic-Spatial Evaluation in Closed and Open Settings
摘要
评估布局引导的文本到图像生成模型需要评估与文本提示的语义对齐以及对规定布局的空间保真度。评估布局对齐需要收集细粒度的注释,这是昂贵且劳动密集型的。因此,当前的基准测试很少提供全面的布局评估,并且往往在规模或覆盖范围上受到限制,使得模型比较、排名和解释变得困难。在这项工作中,我们引入了一个封闭集基准(C-Bench),旨在隔离关键生成功能,同时在提示结构和布局中提供不同级别的复杂性。为了补充这种受控设置,我们提出了一个开放集基准(O-Bench),它使用现实世界的提示和布局来评估模型,提供真实场景中的语义与空间对齐的衡量标准。我们进一步开发了一个统一的评估协议,将语义和空间准确性结合到一个分数中,确保一致的模型排名。使用我们的基准,我们对六种最先进的布局引导扩散模型进行了大规模评估,总共生成和评估了 319,086 个图像。我们根据其整体表现建立模型排名,并提供文本和布局对齐的详细细分,以增强可解释性。跨场景的细粒度分析和提示的复杂性凸显了当前模型的优点和局限性。代码可在 https://github.com/lparolari/cobench 获取。