论文

“我明白你在那里做了什么”:大型视觉语言模型可以理解多模态双关语吗?

"I See What You Did There": Can Large Vision-Language Models Understand Multimodal Puns?

模型评测基准与评测资源

摘要

双关语是一种常见的修辞双关语形式,利用一词多义和语音相似性来创造幽默。在多模态双关语中,视觉和文本元素协同作用,为字面意义奠定基础,同时唤起比喻意义。尽管视觉语言模型(VLM)广泛应用于多模态理解和生成,但由于缺乏严格的基准,它们理解双关语的能力尚未得到系统研究。为了解决这个问题,我们首先提出了一种多模式双关语生成管道。然后,我们介绍 MultiPun,一个包含不同类型双关语以及对抗性非双关语干扰项的数据集。我们的评估表明,大多数模型都很难区分真正的双关语和这些干扰因素。此外,我们提出了提示级和模型级策略来增强双关语理解,F1 分数平均提高了 16.5%。我们的研究结果为开发未来的 VLM 提供了宝贵的见解,这些 VLM 通过跨模式推理掌握类人幽默的微妙之处。