论文

语言模型可以在看不见的情况下想象吗? Ekphrasis:在纯文本中测量视觉创意 LLM

Can Language Models Imagine Without Seeing? Ekphrasis: Measuring Visual Creative Ideation in Text-Only LLMs

模型评测基准与评测资源

摘要

目前的评估并没有隔离纯文本语言模型是否可以在图像生成之前产生视觉概念。流畅的视觉散文可以隐藏视觉计划的失败:答案可能会显得有创意,同时重复熟悉的视觉陈词滥调或未能指定可渲染的场景。我们将视觉创意构思 (VCI) 定义为生成有用、富有表现力和新颖的文本视觉计划的能力,并引入了 Ekphrasis,这是一个涵盖抽象、组合、转换和适应的 400 项任务基准。 Ekphrasis 使用特定维度的清单进行匿名配对比较,使用 Bradley-Terry 模型聚合偏好,并使用类型化想法图将特定任务人群的陈词滥调转换为新颖的参考。在 14 种语言模型中,VCI 将实用性、表现力和新颖性分开,而不是简化为流畅性:强大的模型通过不同的配置文件获得相似的总体分数,而有用的计划可以在视觉上保持陈词滥调。跨模态基础研究进一步表明,文本级 VCI 排序在很大程度上能够幸免于忠实渲染和盲目图像级偏好判断,支持 Ekphrasis 作为超越散文质量的视觉构思衡量标准。