论文
我来了,我看到,我解释:模因中比喻意义的多模态 LLM 基准测试
I Came, I Saw, I Explained: Benchmarking Multimodal LLMs on Figurative Meaning in Memes
摘要
互联网模因代表了多模式在线交流的流行形式,并且经常使用比喻元素通过文本和图像的组合来传达分层含义。然而,目前仍不清楚多模态 大语言模型 (MLLM) 如何结合和解释视觉和文本信息来识别模因中的比喻意义。为了解决这一差距,我们评估了三个数据集中的八个最先进的生成 MLLM,评估它们检测和解释六种比喻意义的能力。此外,我们对这些 MLLM 生成的解释进行人工评估,评估所提供的推理是否支持预测的标签以及它是否仍然忠实于原始模因内容。我们的研究结果表明,所有模型都表现出强烈的偏见,将模因与比喻意义联系起来,即使不存在这样的意义。定性分析进一步表明,正确的预测并不总是伴随着忠实的解释。