论文

MemeBench:LVLM解读文化依赖型迷因时遗漏了什么

MemeBench: What LVLMs Miss When Interpreting Culture-Dependent Memes

模型评测基准与评测资源

摘要

大型视觉语言模型(LVLM)在描述视觉内容方面不断进步,但当含义依赖于像素之外的知识时,准确的描述并不能保证正确的解读。迷因(meme)恰好暴露了这一缺口,因为它们依赖文化实体、背景知识和社群惯例。大多数迷因基准将解读简化为标签或整体分数,掩盖了解释究竟在何处失效。我们提出MemeBench,一个包含1,253个中英文迷因的诊断型基准,配有人工撰写的参考答案和经质量控制的VIKR标注,聚焦动漫、漫画、游戏及相邻的网络亚文化。其VIKR模式将解释分解为Visual clues(视觉线索)、Identity links(身份关联)、Knowledge units(知识单元)与Reasoning mechanisms(推理机制)。在26个LVLM上,所有模型对可见内容的覆盖都比对解读所需知识的覆盖更可靠,即使最强的模型也仍存在22.6%的Visual-Knowledge差距。为检验这一诊断能否指导改进,我们提出KAR,一个基于CultureBase构建的实体引导检索基线。在四个受控模型上,KAR将VIKR Success提升3.6-7.4%,且与通用检索相比修复更多答案、破坏更少。然而在每一次对比中,两种检索条件都在提升Identity与Knowledge的同时降低了Visual覆盖。MemeBench能够揭示一次解读是否成功、缺失什么,以及有针对性的证据能否填补诊断出的缺口。

MemeBench:LVLM解读文化依赖型迷因时遗漏了什么:论文配图
图 3:KAR 管道。 LVLM 线索和实体假设提取、CultureBase 基础、预算实体引导的网络搜索以及基于证据的解释。