论文
Imag-Eval:基于语言的可解释文生图指令遵循评估框架
Imag-Eval: a language-grounded framework for interpretable Text-to-Image instruction following evaluation
摘要
文本到图像 (T2I) 模型最近取得了令人印象深刻的视觉保真度,但其评估仍然受到基准的限制,而基准通常难以解释且诊断不足。现有的基于技能的评估往往忽视严重影响可用性但不属于标准分类法的关键故障模式,例如由于缺少零件或物理上不合理的配置(例如浮动物体)而引起的全局不连贯性。此外,即时难度通常是沿单一维度控制的;提示长度或要生成的元素数量。为了解决这些限制,我们引入了 Imag-Eval,这是一个受控基准,旨在评估 T2I 如何将组合自然语言指令建模为视觉输出。与先前将表面语言复杂性与组合难度混为一谈的工作不同,Imag-Eval 明确寻求通过独立改变实例数量和约束(规则)组合来理清这些因素,同时避免错误传播。这种设计能够对跨模式指令跟踪失败的地方进行细粒度和可解释的分析。我们的基准包括 1,140 个提示和 8,842 个组合规则,我们在几个最先进的模型上对其进行评估。通过对来自并发基准的 2,000 多个提示进行额外研究来补充此分析,我们的结果表明,对于结构化技能,构成难度主要由基础规则的数量及其与实例的绑定决定,而不是仅由提示长度决定。