论文

TangPoetryBench:用于诗歌到图像生成的多维基准和评分标准评估器

TangPoetryBench: A Multi-Dimensional Benchmark and Rubric-Conditioned Evaluator for Poetry-to-Image Generation

模型评测基准与评测资源

摘要

文本到图像(T2I)模型越来越多地被要求来说明文学和文化内容,但我们无法衡量图像如何很好地表达一首诗的含义。这个任务是多方面的:一个好的插图必须在视觉上合理,忠实于诗歌的意象和场景,在文化和风格上恰当,没有虚假的文本,并且忠实于它的情感,而它最深层的要求,意象,特别是隐含的情感,从来没有在文字中表达。现有的指标(CLIPScore、BLIPScore、VQAScore)奖励文字与图像的对应,因此无法判断插图是否成功,更不用说为什么,甚至无法区分最佳模型和最差模型。我们推出了 TangPoetryBench,这是一个包含 1,280 张图像(320 首中国古典唐诗 x 4 个最先进的 T2I 模型)的多维基准,具有跨十个维度的质量控制人类注释。通过分析这些数据,我们揭示了当前 T2I 模型的共享和特定于模型的优点和缺点,包括它们唤起诗歌隐含情感的能力。我们进一步介绍了 PoemAutoEvaluator (PAE),一个开放的、以标题为条件的评估器,它与强大的专有法官 (Claude) 达到同等水平,概括为看不见的生成器和第二个诗歌传统 (Song Ci),并让基准扩展到新图像,而无需新的人工注释。我们发布了基准、注释和评估器。