论文

FAGER:基于事实的文本到图像模型的评估和细化

FAGER: Factually Grounded Evaluation and Refinement of Text-to-Image Models

模型评测评测方法与指标

摘要

现有的文本到图像(T2I)评估指标主要评估生成的图像是否与提示中明确陈述的信息相符,但往往无法捕获隐含的、外部扎根的或身份定义的事实要求。因此,它们不太适合评估涉及科学知识、历史事实、产品或特定文化概念的提示中的事实正确性。我们提出了基于事实的评估和细化(FAGER),这是一种代理框架,用于评估生成的图像是否正确反映基于提示或暗示的视觉可验证事实,同时还提供可操作的反馈以进行改进。 FAGER 首先通过将基于 LLM 的事实提议与参考引导的视觉事实提取和验证相结合来构建结构化事实评分标准,然后将评分标准转换为问答对以进行基于 VLM 的评估。为了验证 FAGER 作为事实指标,我们引入了事实 A/B 测试,该测试衡量指标是否更喜欢事实参考图像而不是相应的生成图像。在涵盖科学、历史、产品、文化和知识密集型概念的五个数据集上,FAGER 在此测试中始终优于先前的指标。我们进一步表明,FAGER 可用于以完全 无需训练 方式细化 T2I 输出,从而在整个数据集中产生大量的事实增益。