论文

MemeCULT-1K:对南亚文化背景和多模态模型的幽默理解进行基准测试

MemeCULT-1K: Benchmarking South Asian Cultural Context and Humor Understanding of Multimodal Models

模型评测基准与评测资源

摘要

模因理解不仅仅是识别视觉内容或文字文本;它需要隐含的文化知识和语用推理,而大多数视觉语言模型仍然缺乏这些知识。我们推出了 MemeCULT-1K,这是一个包含孟加拉语、英语和印地语 1,000 个南亚 meme 的多语言基准,其中每个 meme 都配有文化背景说明和三个人工编写的解释,以及 54 个孟加拉地区方言 meme 的补充集。我们在两种设置下评估了 13 种流行的视觉语言模型 (VLM):仅模因和上下文感知。提供最小的文化背景可以在所有模型和语言中产生一致的收益:平均 SBERT 相似度从 44.6 提高到 56.4 (+11.8),BLEURT 从 37.3 提高到 42.3 (+5.0),LLM-as-a-Judge 分数从 2.57 提高到 3.43(满分 5)(+0.86)。细粒度的错误分析表明,闭源模型的失败主要是由于实体和参考错误识别,而开源模型则受到更广泛的文化知识差距的瓶颈,语言和语音的失败被证明是两者中最具上下文抵抗性的。这些结果凸显了基于文化的模因理解的难度,并激发了未来显性文化知识整合的工作。我们的数据集和代码可在 TawsifDipto17/MemeCULT-1K 上公开获取。