论文

NumBench:诊断文本到图像模型中的计数故障

NumBench: Diagnosing Counting Failures in Text-to-Image Models

模型评测基准与评测资源

摘要

文本到图像 (T2I) 模型经常生成错误数量的对象,但现有基准太小或控制不力,无法解释原因。我们引入了 \textbf{NumBench},这是一个包含 640{,}000 个提示的基准,涵盖 1{,}600 个类别,计数从 1 到 100。其因子设计会改变对象组成、空间引导和外观条件,同时平衡计数和类别曝光。我们还开发了一个过程模型,其中请求的实例竞争一组有限的可解析图像区域。该模型预测低占用率时会出现接近二次方的碰撞赤字,并显示协调放置如何减少碰撞赤字。对于可扩展的评估,我们提出了置信度加权数值精度分数(\cwnps),它聚合了三个校准的检测器并折扣了不确定的建议。在五个商业系统、两个开放模型和两种专门的计数方法中,性能随着请求的计数而急剧下降;所有评估方法在 50 个对象以上都很弱。计数范围对测量的影响最大,其次是布局和构图。网格引导在引导布局中最强,与协调预测一致,尽管分析并未将碰撞确定为唯一原因。一项 14{,}400 张图像的人体研究支持通过计数 50 进行自动评估,而 243 种自然语言提示的结果显示迁移超出了 NumBench 模板。