论文

混合概念:对文本到图像模型中的视觉隐喻生成进行基准测试

Blending Concepts: Benchmarking Visual Metaphor Generation in Text-to-Image Models

模型评测基准与评测资源

摘要

文本到图像(T2I)模型在忠实渲染指定对象和属性方面取得了显着的成功,但它们产生视觉隐喻和通过组合来自两个不同领域的元素来传达抽象思想的图像的能力仍然很大程度上未经检验。为了弥补这一差距,我们引入了 VMetaphor-Bench,这是第一个评估 T2I 模型中视觉隐喻生成的基准。它包含 1,500 个从现实世界的创意图像中挑选出来的视觉隐喻,分为三个级别和十个类别,每个样本都配有两个不同特异性的提示。为了进行评估,我们在 MLLM 作为法官范例中开发了一个混合框架,将基于多项选择问题 (MCQ) 的协议(涵盖四个隐喻保真度级别的 9,594 个问题)与沿三个感知维度的基于维度的评分协议相结合。对 11 个代表性 T2I 模型的广泛评估表明,即使是最强大的专有模型,也难以应对构成结构和跨域映射(隐喻表达的关键方面),这凸显了视觉隐喻生成是未来 T2I 研究的重要前沿。