论文

WeGenBench:文本到图像模型优化的多维诊断基准

WeGenBench: A Multidimensional Diagnostic Benchmark towards Text-to-Image Model Optimization

模型评测基准与评测资源

摘要

最近的文本到图像生成模型已经展示了仅从文本输入合成高度逼真的图像的卓越能力。现有的基准测试虽然可以在一定程度上评估各种模型的生成能力,但难以全面、准确地衡量多个维度的性能,往往无法揭示特定类别模型的固有缺陷。为了解决这些限制,我们提出了 WeGenBench,这是一种新颖的基准,旨在对文本到图像生成能力进行全面、多角度的评估。我们的基准测试包括两个主要类别的总共 4,000 个测试提示,在中文和英语之间进行了精心平衡,以评估双语和跨文化生成能力。除了宏观场景分类之外,我们还使用针对每种语言的不同内容和挑战量身定制的多维标签来注释每个提示,从而将生成任务细化为更具体的子类别。通过场景分类和多维度标签相结合的跨维度评估机制,WeGenBench可以精确定位特定生成类别中的模型缺陷。此外,为了更准确地衡量生成质量,我们通过集成视觉语言模型(VLM)设计和验证了几种新颖的评估指标,从三个核心方面评估模型在特定领域任务上的性能。至关重要的是,我们的方法产生了评估结果和详细的推理轨迹,有助于对评估结果的准确性和合理性进行严格验证。最后,我们对当前最先进的方法进行系统的基准测试,并对现有模型中存在的局限性进行深入分析。