论文
RA-ClipScore:使生成模型评估更易于解释
RA-ClipScore: Making Generative Model Evaluation More Interpretable
摘要
生成模型可以生成与真实数据几乎无法区分的图像,但严格且可解释的评估仍然具有挑战性。 FID 等传统指标仅提供标量分数,诊断洞察力有限。广泛采用的基于 CLIP 的指标使语义评估超越了简单的训练类标签,但继承了 CLIP 训练范式的局限性,限制了属性明智的分析。我们提出了 RA-CLIPScore,这是一种新颖的指标,可以缓解这些问题,并将基于 CLIP 的评估扩展到空间分布对齐,测量生成的对象是否遵循训练数据中发现的位置先验。 RA-CLIPScore 引入了双重提示来解耦竞争属性,并利用本地补丁标记来捕获细粒度的区域语义。我们评估图像生成模型匹配训练数据的属性和空间分布的能力。大量的实验表明,RA-CLIPScore 提供了比以前的方法更稳健和可解释的评估,特别是在分布未对齐或部分不相关的文本属性的情况下。我们进一步证明它如何揭示生成模型中的空间偏差。用户评估证实,基于我们的 RA-CLIPScore 的区域单属性差异比现有的语义指标更符合人类对视觉多样性的感知。