论文
DynEval:T2I 生成模型的整体评估
DynEval: Holistic Evaluations of T2I Generative Models in the Wild
摘要
文本到图像 (T2I) 生成的最新进展使得模型能够生成高度逼真的图像。然而,可靠地评估其产出仍然具有挑战性,尤其是在规模上。现有的自动评估器通常依赖于静态提示集,很难捕获微妙的故障模式,例如部分提示错位、构图错误或视觉上合理但语义上不正确的生成。在这项工作中,我们介绍了 DynEval,这是一种动态评估框架,旨在联合评估 T2I 模型的文本到图像对齐和图像质量。为了支持超出有限的人工注释数据的可扩展训练,我们构建了两个大型数据集。首先,我们构建 GenDB,这是使用分层提示模型生成策略从 DiffusionDB 中提取的人工编写提示生成的 500K 提示图像对的集合。其次,在 GenDB 的基础上,我们构建了 DynEvalInstruct,这是一个 250K 指令数据集,其中包含从结构化评估管道中提取的提示-图像-响应三元组,该管道将评估分解为文本-图像对齐和视觉质量推理。使用该数据集,我们通过课程学习策略执行紧凑评估器的完整 微调,以有效地提炼更大的教师视觉语言模型的卓越评估能力,从而产生 DynEval-2B 和 DynEval-4B。通过与 11 个基准的现有评估器进行广泛比较,我们的评估器实现了与人类判断更高的总体相关性。此外,它还提供了跨 42 个子类别和 9 个语义维度的 36 个 T2I 模型的功能和故障模式的细粒度分析。