论文

Arena-T2I Hard:经依赖感知清单基准测试与改善忠实性

Arena-T2I Hard: Benchmarking and Improving Faithfulness with Dependency-Aware Checklist

模型评测基准与评测资源

摘要

忠实度——生成的图像与其提示相符的精确程度——对于文本到图像(T2I)模型的现实实用性越来越重要。然而,现有的忠实度基准依赖于简单的原子指令,顶级系统已经在这些指令上取得了近乎完美的分数。随着 T2I 模型进入创意工作流程,用户发出多方面的请求,结合了复杂的空间关系、风格约束和复杂的文本渲染。在此设置中,单个二进制 VLM 判断分数不再捕获模型无法满足的特定约束。我们引入了 Arena-T2I Hard,这是一个从真实竞技场 T2I 日志中提取的 310 个提示压力基准,每个提示有大约 30 个分解的是/否约束,涵盖六个类别,包括文本渲染。我们评估的最强闭源系统达到了 0.855,11 个系统之间的性能差距为 33~pp,展示了巨大的判别能力。此外,公共领域的高排名无法预测忠诚度,这证实了整体 Bradley-Terry (BT) 偏好分数优先考虑美观性,而不是细粒度的及时遵守。我们提出了一种依赖性感知清单奖励,将每个提示分解为是/否问题的 DAG,并将失败父母的后代归零,将忠诚度转变为每个约束的训练信号。与通过组解耦标准化 (GDPO) 实现的 BT 美学奖励相结合,该奖励标准化了其推出组内的每个奖励,因此不会崩溃,该方案在 MMRB2 成对比较下的 SD3.5-Medium 和 FLUX.1-dev 上实现了比每个单一奖励、朴素加权和或 4 奖励 BT 整体基线更好的忠实美学权衡。

Arena-T2I Hard:经依赖感知清单基准测试与改善忠实性:论文配图
图 1:每个忠诚度基准有一个代表性提示。现有的 T2I 忠诚度基准依赖于合成模板、LLM 重写简短概念或策划的简短标题;即使是最长形式的前身 DPG-Bench,每个提示平均也只有 ∼70{\sim}70 个单词。我们的 Arena-T2I Hard 从真实的 T2I-arena 用户投票中提取提示,并选择组合难度:提示平均 ∼430{\sim}430 个单词和 ∼30{\sim}30 个分解的是/否问题。