论文

DynT2I-Eval:文本到图像模型的动态评估框架

DynT2I-Eval: A Dynamic Evaluation Framework for Text-to-Image Models

模型评测基准与评测资源

摘要

现有的文本到图像(T2I)基准在很大程度上依赖于固定的提示集,一旦公开发布并反复重用,它们很容易受到过度拟合和基准污染的影响。在这项工作中,我们提出了 DynT2I-Eval,一种用于 T2I 模型的全自动动态评估框架。它从长篇描述构建结构化的视觉语义空间,将提示分解为可控维度(例如主题、逻辑约束、环境和构图)。这使得能够通过特定于任务的空间和难度感知采样不断生成新的提示。 DynT2I-Eval 评估模型在文本对齐、感知质量和美观方面的性能。异构输出被统一为提示条件成对比较,允许动态调度程序、微批量聚合和加权贝叶斯更新,以在提示分布和模型注入发生变化的情况下保持稳定的在线排行榜。对独立采样提示流的实验表明,不断刷新的提示提供了强大的评估协议,减少了特定于提示集的调整的影响。模拟和消融进一步证实,所提出的排名框架在冷启动收敛、后期发现和长期排名保真度之间实现了强有力的平衡。