论文
文本到图像模型中的相似理解:评估框架
Simile Understanding in Text-to-Image Models: An Evaluation Framework
摘要
明喻可以简洁而生动地描述文本提示中的视觉特征。近期文生图模型能根据明喻提示生成视觉效果出色的图像,但即使前沿模型也经常误解喻体,将其与被描述对象混淆。这种系统性失败反映出比喻语言与对象级视觉表达之间的差距。本文提出可扩展的明喻理解评估框架,包括:一组受控明喻数据,其中喻体选自预设的可检测对象类别,并与多种模板组合;基于YOLO对象检测的自动视觉对应指标;使用Diffusion Lens分析文本编码器层,跟踪生成过程中喻体的出现。跨不同架构文生图模型的实验揭示了一致的字面化错误模式。研究还讨论了改善明喻视觉表达的潜在方法。