论文
SpatialBench-UC:文本到图像生成中空间提示遵循的不确定性感知评估
SpatialBench-UC: Uncertainty-Aware Evaluation of Spatial Prompt Following in Text-to-Image Generation
摘要
评估文本到图像模型是否遵循显式空间指令很难自动化。目标检测器可能漏检目标或返回多个合理检测,简单的几何测试在边界情形下可能变得含糊。空间评估天然是一个选择性预测问题——检查器可以在证据薄弱时弃答并报告置信度,使结果可被解读为风险-覆盖权衡而非单一分数。我们提出 SpatialBench-UC,一个针对成对空间关系的小型可复现基准。该基准包含 200 个提示(50 个物体对乘以 4 种关系),分组为通过交换物体角色得到的 100 个反事实对。我们发布基准包、版本化提示、固定配置、逐样本检查器输出与报告表格,支持跨模型的可复现、可审计比较。我们还包含一个轻量级人工审计,用于校准检查器的弃答边际与置信度阈值。我们评估三个基线:Stable Diffusion 1.5、SD 1.5 BoxDiff 和 SD 1.4 GLIGEN。检查器报告通过率、覆盖率以及在已决定样本上的条件通过率。结果表明,grounding 方法显著提升通过率与覆盖率,而弃答仍是主导因素,主要源于漏检。
