论文
Arena-T2I Hard:经依赖感知清单基准测试与改善忠实性
Arena-T2I Hard: Benchmarking and Improving Faithfulness with Dependency-Aware Checklist
摘要
忠实度——生成的图像与其提示相符的精确程度——对于文本到图像(T2I)模型的现实实用性越来越重要。然而,现有的忠实度基准依赖于简单的原子指令,顶级系统已经在这些指令上取得了近乎完美的分数。随着 T2I 模型进入创意工作流程,用户发出多方面的请求,结合了复杂的空间关系、风格约束和复杂的文本渲染。在此设置中,单个二进制 VLM 判断分数不再捕获模型无法满足的特定约束。我们引入了 Arena-T2I Hard,这是一个从真实竞技场 T2I 日志中提取的 310 个提示压力基准,每个提示有大约 30 个分解的是/否约束,涵盖六个类别,包括文本渲染。我们评估的最强闭源系统达到了 0.855,11 个系统之间的性能差距为 33~pp,展示了巨大的判别能力。此外,公共领域的高排名无法预测忠诚度,这证实了整体 Bradley-Terry (BT) 偏好分数优先考虑美观性,而不是细粒度的及时遵守。我们提出了一种依赖性感知清单奖励,将每个提示分解为是/否问题的 DAG,并将失败父母的后代归零,将忠诚度转变为每个约束的训练信号。与通过组解耦标准化 (GDPO) 实现的 BT 美学奖励相结合,该奖励标准化了其推出组内的每个奖励,因此不会崩溃,该方案在 MMRB2 成对比较下的 SD3.5-Medium 和 FLUX.1-dev 上实现了比每个单一奖励、朴素加权和或 4 奖励 BT 整体基线更好的忠实美学权衡。
