论文

MaSC:用于评估概念驱动生成的屏蔽相似性度量

MaSC: A Masked Similarity Metric for Evaluating Concept-Driven Generation

模型评测评测方法与指标

摘要

评估文本到图像扩散中的单一概念个性化需要测量概念保留(捕获参考的身份保真度)和提示跟随(捕获生成的场景是否与提示匹配)。现有指标通常使用全局图像或文本图像嵌入来计算这些信号,例如 CLIP-I、DINO 和 CLIP-T。我们表明,这些指标与人类感知的相关性很差,因为它们关注图像的整体,而不是将概念主体与背景分开。我们引入了 MaSC,一种掩码相似性度量,它使用外部提供的前景概念掩码将评估分解为特定于主题的概念保留和基于背景的提示跟随。 MaSC 根据冻结的 SigLIP2 SO400M-NaFlex 特征计算这两个分数:概念保留是通过前景参考补丁和生成图像补丁之间的掩蔽最大余弦匹配来测量的,而提示跟随是通过将仅背景池图像嵌入与主题剥离提示嵌入进行比较来测量的。在 DreamBench++ 人类评级中,MaSC 在概念保存方面达到了 Krippendorff alpha = 0.471,优于所有测试的非 LLM 基线和 GPT-4V,并接近 GPT-4o。在 ORIDa(跨物理环境的真实照片身份保存基准)上,MaSC 实现了 AUC = 0.992,几乎完美地区分了同一对象与跨对象对。其提示跟踪分数也优于 DreamBench++ 附带的 CLIP-T 基线。这些结果表明,空间分解聚合是评估概念驱动生成的强大设计原则。